Skip to content

模型怎么选:Claude 与 GPT 家族

选模型不是"永远用最强的",而是按任务的难度、时长、预算匹配档位。日常 Agent 编程的大部分轮次是改文件、跑命令这类中等难度操作,用旗舰模型跑这些就是烧钱;而架构设计、疑难 bug、跨模块重构,低档位模型又容易返工——返工的总成本反而更高。

Claude 家族

Claude Fable 5(Mythos 级)

Anthropic 于 2026 年 6 月发布的新档位:Fable 5 与 Claude Mythos 5 共享同一底层模型,同属高于 Opus 的 "Mythos 级"。Fable 5 是可公开使用的版本,针对网络安全、生物等双重用途能力附加了安全措施;Mythos 5 则仅向获批组织开放。详见 Anthropic 官方公告

适合:当前公开可用的最高智能档——最难的任务:大型架构设计与评审、深度调试、长程多步 Agent 任务、对正确率要求极高的一次成型工作。不适合:高频、简单、对延迟敏感的批量任务(贵且慢,杀鸡用牛刀)。

Claude Opus 5

2026 年 7 月发布,定位"接近 Fable 5 的能力、一半的价格"($5/$25 每百万输入/输出 token),是 Claude Max 的默认模型,也是官方公告中编码与知识工作评测的主力旗舰。

适合:日常 Agent 编程的主力——绝大多数开发任务的默认选择。能力/成本平衡点最好,支持 [1m] 长上下文(见上下文窗口篇)。

Claude Opus 4.6 / 4.8(上一代)

Opus 4.6(2026 年 2 月)是有历史意义的一版:首个带 1M 上下文的 Opus、首次引入 adaptive thinking 与 effort 档位(见下文)、128K 最大输出。其后被 Opus 4.8 迭代取代。

适合:如今主要作为兼容与降级选项——例如 Fable 5 在受限领域会回退到 Opus 4.8;或你的平台(Bedrock/Vertex/Foundry)尚未上架 5 代时的选择。新项目直接用 Opus 5 即可。

Claude Sonnet 5

与 Fable 5 同期(2026 年 6 月)的中档主力,价格明显低于 Opus,速度更快。

适合:量大、结构清晰的工作——CRUD 与样板代码、测试编写、文档生成、代码解释,以及子代理:主对话用 Opus/Fable 做决策,把批量探索、逐文件检查分派给 Sonnet 跑,是最常用的省钱结构。再往下还有 Haiku 4.5,适合分类、抽取、简单问答这类高频轻任务。

GPT-5.6 家族:Sol / Terra / Luna

OpenAI 2026 年 6 月底发布 GPT-5.6 时放弃了 mini/nano 命名,改用三个按用途划分的档位(官方介绍),在 ChatGPT、Codex 和 API 中提供:

档位定位适合
Sol(日)家族最高推理上限,OpenAI 称其为"最强编码模型"大代码库上的复杂推理、长时间运行的高难度 Agent 任务;在 Codex 里跑重活选它
Terra(地)均衡默认档,性能对标 GPT-5.5 而价格减半日常交互式编码和一般 Agent 任务的默认选择
Luna(月)轻量低价($1/$6 每百万 token)小而快的任务:补全、格式化、简单问答、批量流水线

对应关系可以粗略记为:Sol ≈ Fable/Opus 档,Terra ≈ Sonnet 档,Luna ≈ Haiku 档。两家在旗舰档互有胜负(如 OpenAI 称 Sol 在 Coding Agent Index 上略高于 Fable 5),实际选择更多取决于你的工具链(Claude Code vs Codex)、订阅和缓存/生态因素,而非榜单上两三分的差距。

思考强度(Effort)是什么

现代推理模型在给出答案前可以先进行内部思考(推理链)。"思考强度"(effort / reasoning effort)就是控制模型在思考上投入多少计算的旋钮。以 Claude 为例(自 Opus 4.6 引入,4.7+ 成为标准方式):

  • 档位通常为 low / medium / high / max(Claude Code 中 API 侧另有扩展档位);
  • 默认是自适应思考(adaptive thinking):模型根据任务难度自己决定想多少——简单问题几乎不想,难题深入推演;effort 档位调整的是这个决策的整体倾向;
  • effort 不只影响思考长度,也影响整体输出的详尽程度(文本与工具调用都会更"用力")。
档位行为用在
low几乎直答,最快最便宜机械改动、格式化、简单问答
medium适度思考常规开发任务
high(常见默认)充分思考调试、设计、多步骤任务
max不设上限地推理,最慢最贵疑难 bug、架构决策、竞赛级难题

在 Claude Code 里:用 /effort(或 Tab 切换思考档)调整;也可用环境变量 CLAUDE_CODE_EFFORT_LEVEL=low|medium|high 预设。OpenAI 侧的对应物是 reasoning_effort 参数(minimal/low/medium/high),Codex CLI 中同样可配。

与缓存的交互

在会话中途改变 effort 档位会使提示缓存失效。建议一个会话固定一个档位,单轮想要更深思考时,用提示词引导("仔细想清楚再动手")而不是切档位。

Thinking Budget(思考预算)是什么

比 effort 档位更早、更"手动"的控制方式:直接给思考过程设一个 token 预算上限。在 Anthropic API 中即 extended thinkingbudget_tokens:

python
resp = client.messages.create(
    model="claude-sonnet-4-5",
    max_tokens=16000,
    thinking={
        "type": "enabled",
        "budget_tokens": 8000,   # 思考最多用约 8K token
    },
    messages=[...],
)

必须知道的几件事:

  1. 预算是目标不是硬限:模型想清楚了会提前停,不会硬凑满;
  2. 思考 token 按输出计费,并占用上下文窗口——预算给 32K,意味着单轮最多可能多花 32K 输出 token 的钱;
  3. 最小 1024;官方建议从小往大调,而不是一步到位给最大;
  4. 正在被 effort 取代:budget_tokens 手动模式在 Claude 4.6 上已标记废弃,4.7 及之后的模型直接拒绝该参数——新代码应使用 adaptive thinking + effort;
  5. Claude Code 中的历史对应物是 MAX_THINKING_TOKENS 环境变量,在新模型上仅 =0(完全关闭思考)仍有意义,其余情况用 effort 档位。

一句话区分:thinking budget 是"给思考划一块定量的 token 配额"(旧范式),effort 是"告诉模型该多用力"由它自适应分配(新范式)。两者控制的都是同一件事——推理深度与延迟/成本的权衡。

实战搭配建议

  1. 日常主力:Claude Code 用 Opus 5(high effort);Codex 用 Terra——都是各自生态的均衡点;
  2. 难题升档:卡住的 bug、架构评审,切 Fable 5 / Sol,并允许更高思考强度;换模型请在会话边界做(缓存按模型隔离,见缓存策略篇);
  3. 批量降档:子代理、CI 里的自动化检查、代码解释,用 Sonnet 5 / Luna,thinking 调低甚至关闭;
  4. 别用思考弥补上下文烂:上下文里塞满噪音时,加大 effort 只是让模型更贵地在垃圾里翻找——先做好上下文管理,再谈思考强度。

本页涉及的模型信息基于 2026 年 8 月的公开资料,更新很快,采购/接入前请以各家官方文档为准。主要来源:Anthropic: Fable 5 & Mythos 5Anthropic: Opus 5Anthropic: Opus 4.6OpenAI: GPT-5.6Extended thinking 文档

AI Coding Guideline — 面向 Claude Code / Codex 等 AI 编程工具的实践指南