简短回答
支持。 API易 的 Claude、OpenAI、Gemini、DeepSeek、Qwen、Grok 等主流通道都支持缓存计费:缓存相关请求参数原样转发上游,响应里的缓存命中字段原样回吐,后台账单按官方折扣倍率单列缓存计费项 —— 你的代码无需为中转层做任何适配。 其中 Claude 和 OpenAI 的缓存命中稳定好用(站内有专门指南,见下方链接);DeepSeek、Qwen、Grok 也好用;Gemini 的隐式缓存虽然支持,但命中率一般,建议不要把成本预算押在 Gemini 缓存上。三大通道对比
各通道说明
OpenAI:全自动,最省心
请求前缀不少于 1024 tokens 且保持稳定,就自动命中,命中部分按输入价 1 折计费,没有写入费 —— 第 2 次请求即净省。怎么写出会命中的请求、怎么用prompt_cache_key 提高命中率,见 OpenAI Prompt Caching 缓存计费指南。
Claude:手动打标记,省得最狠
在要缓存的 content block 上打cache_control 标记,命中按 0.1× 计费(写入收 1.25× / 2×)。Claude Code、Cline、Cursor 等深度场景必备。注意只在 Anthropic 原生格式(/v1/messages)下生效,用 OpenAI 兼容格式调 Claude 拿不到缓存。详见 Claude Prompt Caching 缓存计费指南。
Gemini:支持但别指望太高
API易 对 Gemini 原生格式自动启用隐式上下文缓存,命中部分按 Google 官方折扣计费。但实际使用中 Gemini 的缓存命中率明显不如 Claude / OpenAI(上游隐式缓存的命中行为不可控),建议:- 把缓存折扣当作”有则更好”的额外优惠,做成本测算时按无缓存价格估算
- 对缓存敏感的高频长前缀业务,优先选 OpenAI 或 Claude 通道
DeepSeek / Qwen / Grok 等其它通道
这几家的缓存都是全自动的(无需打标记),通过 API易 调用同样正常命中,实际体验良好:
提高命中率的思路和 OpenAI 一致:稳定内容放前面、动态内容放后面,时间戳和随机 ID 别放 prompt 开头。具体玩法可直接套用 OpenAI 缓存计费指南 里的”稳定前缀”方法论。
怎么确认自己命中了
看响应usage 里的缓存字段:
字段大于 0 即命中。后台调用日志中,命中部分会按折扣倍率单列计费项,可直接核对。
注意事项
- 缓存按模型隔离:换模型(哪怕同系列不同档位)不共享缓存
- 上表未列出的其它厂商模型(如 Kimi 等),缓存支持情况以调用日志实际回吐的缓存字段为准
- 各家官方机制细节可参考:
platform.openai.com/docs/guides/prompt-caching、docs.claude.com/en/docs/build-with-claude/prompt-caching、ai.google.dev/gemini-api/docs/caching、api-docs.deepseek.com/quick_start/pricing、docs.x.ai/developers/advanced-api-usage/prompt-caching
相关文档
OpenAI 缓存计费指南
全自动缓存:1024 tokens 起步、命中 1 折、prompt_cache_key 提高命中率
Claude 缓存计费指南
cache_control 怎么打、回本点计算、多轮对话进阶玩法
模型倍率说明
了解控制台分组倍率与美元价格的换算关系
调用日志查询
查看每次请求的 tokens 消耗和缓存计费明细
联系我们
企业微信客服
邮件咨询
客服邮箱:support@apiyi.com商务合作:business@apiyi.com
