跳转到主要内容
Grok 是 xAI 推出的旗舰大模型家族。当前一代(Grok 4.x)覆盖旗舰通用、长上下文标准档、推理/非推理双变体、代码专用与多智能体协作五条产品线,全部已上架 API易。xAI 官方 API 本身就是 OpenAI 兼容格式(Chat Completions + Responses API),没有独立的私有协议——因此在 API易 上用 OpenAI SDK 即可调用全部能力,包括官方的 server-side 工具(联网搜索、X 搜索、代码执行、Remote MCP)。 本组文档基于 2026年7月13日 (UTC+8) 在 API易 网关上的全量实测(56 组请求/响应日志)编写,能力边界均有实测依据。
🚀 核心亮点:grok-4.5 是 xAI 于 2026年7月8日 发布的最新旗舰(知识截止 2026年2月),主打代码与 Agent 任务;grok-4.3 与 grok-4.20 系列提供 100 万 tokens 上下文;Responses API 的 web_search / x_search / code_interpreter / MCP 四大工具在 API易 实测真实可用,其中 X 搜索是 Grok 独有的差异化能力;原生 responses 协议还意味着 Grok 可以直接接入 OpenAI Codex

模型阵容

grok-4.5

旗舰 · 代码与通用xAI 最智能模型,500K 上下文,为编码、Agent 任务和知识工作构建。

grok-4.3

标准主力1M 上下文,价格是旗舰的六折出头,日常对话与中等推理的均衡之选。

grok-4.20 双变体

推理 / 非推理可选-reasoning-non-reasoning 同价同上下文(1M),按需选择是否输出思维链。

grok-build-0.1

代码专用256K 上下文,全系最低单价,适合高频代码补全与轻量编程任务。

grok-4.20-multi-agent-beta-0309

多智能体协作多个 agent 并行协作解题,适合复杂研究任务。计费特性特殊,详见 Multi-Agent 模型

更多能力页

对话/推理/视觉见 对话与推理;联网见 联网搜索与 X 搜索

模型定价

挂牌价与 xAI 官网一致(已于 2026-07-13 经 API易 定价接口逐一核对),API易 的折扣体现在 充值加赠活动 中。
  • 别名 grok-code-fast / grok-code-fast-1 亦可调用(实测连通),定价以 模型价格页 为准。
  • 缓存命中的输入 tokens 享受折扣价,Grok 前缀缓存自动生效、无需配置,详见 缓存计费说明
  • 挂牌价持平官网,叠加 充值加赠 后实际成本更低。

实测能力矩阵

以下矩阵来自 2026-07-13 (UTC+8) 在 API易 网关的实测(✅ 实测通过;— 未覆盖,同架构预期一致):

端点一览

在 Codex 中直接使用

因为原生支持 /v1/responses,Grok 是少数能在 OpenAI Codex(桌面客户端 / IDE 插件 / CLI)里以 responses 原生协议直接使用的非 OpenAI 模型——config.tomlmodel = "grok-4.5"wire_api = "responses" 即可,5 分钟接上,Codex 的工具调用、推理条目等 Agent 能力全走原生协议。对比之下,Claude / Gemini 在 API易 上只能走 OpenAI 兼容 chat 模式(wire_api = "chat" 兜底),在 Codex / Agent 场景存在协议不兼容。完整接入步骤见 Codex 接入教程
以下能力在 API易 上不支持(实测确认,避免踩坑):
  • Legacy Completions(/v1/completions:上游拒绝——Grok 4.x 全系为推理架构,官方层面即不支持文本补全模式
  • 联网旧入口 search_parameters:已被 xAI 下线(实测返回 410),联网一律走 Responses API 工具,见 联网搜索
  • Batch API / Files 文件能力:网关不路由,号池模式不适用
  • Deferred Completions(deferred: true:参数会被静默忽略,请求按同步执行并正常计费,请勿依赖
  • Collections Search(RAG / file_search):需在 xAI 控制台预建知识库,号池模式不适用
  • Context Compaction(/v1/responses/compactPriority Processing(service_tier: "priority",实测回落 default)WebSocket 模式mTLS 认证:均不支持

快速开始

模型怎么选:默认用 grok-4.3(1M 上下文、价格均衡);代码 Agent / 复杂任务升级 grok-4.5;追求快答低成本用 grok-4.20-0309-non-reasoning(无思维链、输出 tokens 最省);高频代码补全用 grok-build-0.1;复杂研究类任务才考虑 multi-agent 模型(注意其计费放大特性)。

计费注意:思维链 tokens

grok-4.5 / grok-4.3 / grok-build-0.1 默认带内部推理:响应中返回 reasoning_content,且推理 tokens 计入输出计费。实测短问答中可见文本仅 30 tokens、实际计费输出 586 tokens(含 556 推理 tokens)。对成本敏感的短问答场景,建议改用 grok-4.20-0309-non-reasoning。详细说明见 对话与推理

常见问题

没有独立私有协议。xAI 官方 REST API 就是 OpenAI 兼容格式:/v1/chat/completions(对话)+ /v1/responses(Responses API 与 server-side 工具)。在 API易 上用 OpenAI SDK 把 base_url 指向 https://api.apiyi.com/v1 即为全功能调用,不存在”兼容模式阉割”。
走 Responses API:tools: [{"type": "web_search"}](或 x_search)。旧版 Chat Completions 的 search_parameters 参数已被 xAI 下线(实测 410),不要再使用。详见 联网搜索与 X 搜索
正常现象。Grok 4.x 全系的自我认知均为「Grok 4」(multi-agent 模型自称 Oppie),不会精确报出 4.5 / 4.3 等版本号。验证模型身份请以请求的 model 字段和响应 model 字段为准,而非模型的自我介绍。
不需要。Grok 前缀缓存自动生效,响应 usage.prompt_tokens_details.cached_tokens 可自查命中量(实测同前缀第二次请求命中 2688/2735 tokens)。网关为号池模式,命中率请做合理预期,详见 缓存计费说明
返回 400 错误。注意各档上限不同:grok-4.5 为 500K,grok-4.3 与 4.20 系列为 1M,grok-build-0.1 为 256K。超长内容建议先做摘要 / 分段 / RAG 检索。
4xx 类客户端错误(参数错误 / 鉴权失败)不计费;已成功返回 tokens 的请求按实际消耗计费。注意 deferred: true 会被静默忽略——请求实际同步执行并正常计费。

相关文档

对话与推理

流式、思维链、结构化输出、函数调用、视觉输入、缓存

联网搜索与 X 搜索

Responses API 的 web_search / x_search 工具实战

代码执行与 MCP

服务端 Python 沙箱与 Remote MCP 工具接入

Multi-Agent 模型

多智能体协作模型的能力与计费特性

在 Codex 中使用 Grok

原生 responses 协议直连 Codex,5 分钟接上

Grok 4.5 发布解读

xAI 最新旗舰的深度解读

模型信息总览

查看所有可用模型及分组