SmartRelay 智能优化
SmartRelay 智能优化引擎
Section titled “SmartRelay 智能优化引擎”SmartRelay 在每次请求路径上自动运行、用户无感,围绕两大核心——缓存命中率最大化 与 会话上下文压缩——让你的每一分预算更耐用。
一、缓存命中率技术
Section titled “一、缓存命中率技术”1. 会话粘滞路由(Session Affinity)— 核心壁垒
Section titled “1. 会话粘滞路由(Session Affinity)— 核心壁垒”多轮对话中,平台把同一会话的后续请求,始终路由到同一上游节点,使上游 Prompt Cache 在整段会话里持续保持热缓存、连续命中。
多数中转 / 聚合服务采用轮询或负载均衡,每一轮请求都可能落到不同节点,导致缓存反复失效、命中率极低。SmartRelay 的会话粘滞让你的缓存不被打散——这是我们缓存命中率显著领先同行的根本原因。
2. 缓存断点智能注入(Auto Cache Breakpoint)
Section titled “2. 缓存断点智能注入(Auto Cache Breakpoint)”自动在最优稳定前缀边界(System 提示词、Tools 工具定义)插入 cache_control 缓存标记。即使你的客户端没有手动开启缓存,也能吃满官方 Prompt Caching——缓存命中部分最高省 90%。比手动配置更稳、更激进。
3. 响应缓存(Response Cache)
Section titled “3. 响应缓存(Response Cache)”完全相同的请求直接命中本地缓存,零延迟、零费用。适合高频固定 prompt、模板化问答、多端共享同一 prompt 的场景。
二、会话压缩技术
Section titled “二、会话压缩技术”4. 上下文压缩(Context Compaction)
Section titled “4. 上下文压缩(Context Compaction)”针对 Claude Code / Cursor / Codex 这类超长多轮 Agent 会话,对历史上下文智能压缩:保留关键信息、削减冗余 token,让长会话不会越跑越贵。
5. 工具响应截断(Tool Output Artifact)
Section titled “5. 工具响应截断(Tool Output Artifact)”工具调用返回超长时自动截断为引用,避免每轮都把大段工具输出反复塞进上下文——按业界 Agent 工程最佳实践。
省下的不计费
Section titled “省下的不计费”通过以上缓存与压缩节省下来的 token,全部不计入你的账单。命中率越高、会话越长,省得越多——尤其适合 Claude Code 这类高缓存、长上下文的真实工程场景。
怎么看自己的优化效果
Section titled “怎么看自己的优化效果”控制台 → 用量日志 → 顶部「SmartRelay 节省」卡片,展示你近 30 天节省的 Tokens / 估算价值 / 缓存命中数等指标。首页也会展示全站累计节省数据,每分钟自动刷新。