跳转到内容

SmartRelay 智能优化

SmartRelay 在每次请求路径上自动运行、用户无感,围绕两大核心——缓存命中率最大化会话上下文压缩——让你的每一分预算更耐用。

1. 会话粘滞路由(Session Affinity)— 核心壁垒

Section titled “1. 会话粘滞路由(Session Affinity)— 核心壁垒”

多轮对话中,平台把同一会话的后续请求,始终路由到同一上游节点,使上游 Prompt Cache 在整段会话里持续保持热缓存、连续命中

多数中转 / 聚合服务采用轮询或负载均衡,每一轮请求都可能落到不同节点,导致缓存反复失效、命中率极低。SmartRelay 的会话粘滞让你的缓存不被打散——这是我们缓存命中率显著领先同行的根本原因。

2. 缓存断点智能注入(Auto Cache Breakpoint)

Section titled “2. 缓存断点智能注入(Auto Cache Breakpoint)”

自动在最优稳定前缀边界(System 提示词、Tools 工具定义)插入 cache_control 缓存标记。即使你的客户端没有手动开启缓存,也能吃满官方 Prompt Caching——缓存命中部分最高省 90%。比手动配置更稳、更激进。

完全相同的请求直接命中本地缓存,零延迟、零费用。适合高频固定 prompt、模板化问答、多端共享同一 prompt 的场景。

4. 上下文压缩(Context Compaction)

Section titled “4. 上下文压缩(Context Compaction)”

针对 Claude Code / Cursor / Codex 这类超长多轮 Agent 会话,对历史上下文智能压缩:保留关键信息、削减冗余 token,让长会话不会越跑越贵。

5. 工具响应截断(Tool Output Artifact)

Section titled “5. 工具响应截断(Tool Output Artifact)”

工具调用返回超长时自动截断为引用,避免每轮都把大段工具输出反复塞进上下文——按业界 Agent 工程最佳实践。

通过以上缓存与压缩节省下来的 token,全部不计入你的账单。命中率越高、会话越长,省得越多——尤其适合 Claude Code 这类高缓存、长上下文的真实工程场景。

控制台 → 用量日志 → 顶部「SmartRelay 节省」卡片,展示你近 30 天节省的 Tokens / 估算价值 / 缓存命中数等指标。首页也会展示全站累计节省数据,每分钟自动刷新。