qwen3.8-max)是阿里通义千问 2026 年 8 月 3 日发布的新一代旗舰,稀疏 MoE 架构、2.4 万亿总参数,支持 1M 上下文、131K 最大输出,原生接受文本、图片、视频三种输入。API易在发布当天上架,并完成了 586 次实测调用——本页的能力矩阵、参数行为与计费提醒全部来自实测,不是转述官方文档。
API易已接入 Qwen3.8-Max:模型名
qwen3.8-max。默认开启深度思考(默认 xhigh 档,思考 tokens 计入输出计费),日常对话建议显式设 reasoning_effort="none",实测输出可从约 158 tokens 降到 5 tokens。上一代见 Qwen3.6 系列(历史版本)。核心优势
比官网便宜 17.5%
输入 $1.65、输出 $4.95 每 1M tokens,阿里云官网为 $2/$6。可叠加充值活动继续下探。
1M 上下文实测可用
8K / 32K / 128K 三档正文,中部与尾部各埋一枚标识,两个端点 6/6 全部精确召回。128K 单次约 80 秒。
一个模型三种模态
文本、图片、视频输入全部实测通过,无需在「长文模型」和「视觉模型」之间切换。
Agent 能力大幅提升
FrontierSWE 由上代 40.7 升至 73.5,DeepSWE 21.6 → 56.6。工具调用链路完整,两轮 round-trip 实测通过。
端点支持
模型定价
每 1M tokens,折扣前挂牌价:
可叠加充值活动,实际成本更低。
技术规格
官方基准:GPQA Diamond 92.6、PaperBench 93.0、OmniDocBench 1.5 92.1、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1、IFBench 82.8、FrontierSWE 73.5、SWE-bench Pro 67.7。
思考控制(最重要的一节)
Qwen3.8-Max 默认就在思考,档位为xhigh。思考 tokens 计入输出计费,且占比常达 90% 以上。
reasoning_effort 七个值,四个真实档位
参数接受 7 个值,但实测只对应 4 个真实档位:
传
max 不会比 xhigh 想得更多。传其他值会返回 400 并列出合法值。
关闭思考的写法
extra_body 里的 enable_thinking: false 与 chat_template_kwargs: {"enable_thinking": false} 同样生效,效果等价。
thinking_budget 不生效
传 128 / 512 / 4096 任何数值,实测行为都等同于 low 档,数值不起作用。请改用 reasoning_effort。
调用示例
Python(OpenAI SDK 兼容)
图片输入
url 填成 https://... 即可。
视频输入
{"type": "video", "video": [帧1, 帧2, ...]},要求 4–8000 帧,少于 4 帧会返回 400。
cURL
工具调用
Chat Completions 端点的工具调用完整可用:单工具、并行多工具、两轮 round-trip、20 个工具中选 1、流式增量拼接、parallel_tool_calls: false 全部实测通过。
结构化输出
response_format 的 json_schema 实测严格守约:嵌套对象、枚举、数组、additionalProperties: false 全部生效,无多余字段、无 Markdown 代码块包裹。
上下文缓存
- 命中门槛约 1024 tokens:818 tokens 的前缀不命中,1070 tokens 起命中
- 真实多轮对话吃得到缓存:逐轮追加消息的场景每轮都命中
- 长文收益显著:128K 上下文实测缓存命中 98.6%,32K 命中 99.3%
Anthropic 端点用法
/v1/messages 可用于代码集成,但回传历史消息前需要剥掉 thinking 块,否则返回 400(if content is list. item must be dict and key[type] should in dict)。
2026-08-08 追加复测:多轮工具调用本身没问题
一轮 300 次调用的专项复测,结论是多轮tool_use / tool_result 链路本身是好的,卡点只在 thinking 块:
tool_result没有任何额外格式限制:content为字符串或 block 数组、is_error真假、空结果、50KB 大结果、乱序回传、只回传部分、伪造tool_use_id——15 种形态全部通过。控制字符、emoji、20 万字符单行也都能过。thinking块的signature取什么值都救不了:空串、null、整个 key 缺失、伪造值,四种全部返回同一个 400。只能删掉整个块。- 剥掉
thinking后压力测试通过:24K token 系统提示词 + 8 个工具的自主 agent 循环,12 轮 × 2 组,上下文涨到 28.7K,24/24 全部成功。 - SSE 事件完整:
message_start/content_block_start/content_block_delta/content_block_stop/message_delta/message_stop齐全,另有ping;text_delta/thinking_delta/signature_delta/input_json_delta都正常。 - 没有速率或并发限制:同一请求顺序重复 40 次全部成功,并发 1 / 4 / 8 / 16 / 32 各档全部成功,未出现 429。
想在 Claude Code 里用怎么办
这类「特定客户端里跑不起来」的问题,未必是我们这边的适配问题,也可能是模型侧本来就不支持。建议先去阿里云百炼官方平台用同样的用法验证一次(控制台:bailian.console.aliyun.com):
- 如果官方平台同样不支持,那就是模型侧的限制,我们这边也绕不过去;
- 如果官方平台可以、我们这边不行,请把请求体发给我们,我们跟渠道方对齐。
其他差异与实测注意
response_format被静默忽略(结构化输出请改用工具强制)tool_choice只接受 OpenAI 格式;强制工具调用(required或指定函数)在思考模式下两个端点都不支持- 图片只支持 base64,远程 URL 返回 400
reasoning_effort不生效,关思考请用thinking: {"type": "disabled"}stop_sequences截断本身生效,但stop_reason会误报成end_turn、stop_sequence字段返回null,不要依赖它判断停止原因- 流式 usage 因线路而异:部分线路
message_start里的input_tokens不可信,部分线路流式最终output_tokens恒为 0。需要精确核算时请以非流式返回的 usage 或账单为准 - 输入长度上限实测 983,616 tokens,超出返回
Range of input length should be [1, 983616]
参数兼容性
最佳实践
日常对话与高频调用
显式设
reasoning_effort="none"。实测耗时从约 5 秒降到 2 秒、输出 tokens 降到 1/30。长文档与代码库分析
128K 召回实测精确,长文缓存命中率高。把大文档放在消息前部,追问放在尾部。
数据抽取
用
json_schema 约束结构,同时关思考。守约程度不受影响。Agent 与工具编排
走
/v1/chat/completions。需要强制调用时记得关思考。常见问题
为什么我设了 max_tokens 还是被扣了很多 token?
为什么我设了 max_tokens 还是被扣了很多 token?
max_tokens 只约束可见回答,不约束思考部分。实测 max_tokens=1 仍被计 1054 个输出 token。控制成本请用 reasoning_effort="none"。为什么 tool_choice 指定了函数却报 400?
为什么 tool_choice 指定了函数却报 400?
思考模式下不支持
tool_choice 强制调用。请同时传 reasoning_effort="none"。为什么 /v1/responses 调不通?
为什么 /v1/responses 调不通?
该端点对本模型暂未接入,30 次测试全部失败(错误码在 404 与 400 之间跳变)。已反馈渠道方,接通后会在实时动态公告。请改用
/v1/chat/completions。Claude Code 能用这个模型吗?
Claude Code 能用这个模型吗?
暂时不能。
/v1/messages 端点拒绝含 thinking 块的历史消息,而 Claude Code 默认原样回显,所以第一轮能出 tool_use、回传 tool_result 后第二轮就 400。自己写代码调用时剥掉该块即可正常使用。需要在 Claude Code 里干活的话,建议直接用本站的 Claude 系列或 OpenAI 系列,默认分组就是官转,不需要额外适配。也可以先去阿里云百炼官方平台(bailian.console.aliyun.com)验证同样的用法是否支持——如果官方平台同样不支持,那是模型侧的限制。为什么第一轮好好的,回传工具结果后就卡住/报错?
为什么第一轮好好的,回传工具结果后就卡住/报错?
这是
/v1/messages 端点上最典型的表现。原因是回传的历史 assistant 消息里带了 thinking 块,该端点不接受,返回 400。signature 改成空串、null 或删掉这个字段都没用,必须删掉整个 thinking 块。实测剥掉之后,24K 上下文的 12 轮工具循环可以稳定跑完。多轮 tool_use / tool_result 链路本身没有问题。usage 里为什么有时没有 reasoning_tokens / 缓存字段?
usage 里为什么有时没有 reasoning_tokens / 缓存字段?
该模型背后有多条上游线路,各线路回显的 usage 字段不一致:有的不回
reasoning_tokens 与 cached_tokens,有的 cache_read_input_tokens 恒为 0,有的流式最终 output_tokens 恒为 0。已反馈渠道方统一口径。接口回显不代表实际计费。 需要精确核算时,请以控制台日志里单条请求的计费详情为准,那里会列出基础费用与缓存费用的完整计算过程。视频调用为什么很慢?
视频调用为什么很慢?
视频理解单次实测 144–285 秒,属于模型本身的处理耗时。请把超时设到 300 秒以上,并考虑用异步队列承接。
相关文档
- Qwen3.8-Max 在线调试 — Playground 直接发请求
- Qwen3.6 系列(历史版本) — 上一代五款模型
- Qwen3.8-Max 上线说明 — 基准数据与完整解读
- 模型价格 — 全站模型单价、缓存价格与可用端点
- 充值优惠活动 — 叠加折扣
本页实测数据来自 2026-08-03 的 586 次调用(12:50–14:35 UTC+8),以及 2026-08-08 针对 Anthropic 端点多轮工具调用的 300 次专项复测(22:10–2026-08-09 00:40 UTC+8)。接口返回的 usage 字段在不同上游线路间口径不一致,计费请以控制台日志的计费详情为准。模型与网关行为可能随渠道调整而变化,以实际调用为准。