Skip to content

总览:AI 编程的核心心智模型

用 Claude Code、Codex(OpenAI 的编程 Agent)、Cursor 这类工具写代码,和"跟 ChatGPT 聊天"是两件完全不同的事。聊天是一问一答;而编程 Agent 会在一轮任务里自主执行几十上百次工具调用——读文件、跑命令、改代码、看测试输出——每一步的输入输出都会累积进同一个上下文窗口。

因此,决定你使用体验(速度、成本、质量)的,不是"提示词写得妙不妙",而是三件更底层的事:

1. 上下文是稀缺资源

模型的上下文窗口(200K 或 1M token)是 Agent 的"工作记忆"。系统提示、工具定义、CLAUDE.md、每一次文件读取、每一条命令输出,全都在消耗它。上下文被塞满后:

  • 模型开始"遗忘"早期的指令和约定,输出质量下降(context rot);
  • 触发压缩(compact)或截断,丢失细节;
  • 每一轮请求都变得更慢、更贵。

所以本指南的大量篇幅都在讲怎么省着用上下文:理解 token理解窗口大小避免工具爆炸用 Skills 按需加载用 RepoPrompt 预构建上下文

2. 缓存决定了成本和速度

Agent 的每一轮请求都会把整个对话历史重新发给模型。没有缓存的话,一个 100 轮的任务要把开头的内容重复计费 100 次。Prompt Caching 让"前缀不变的部分"以 1/10 的价格命中缓存——但前提是你不破坏前缀。一次不经意的系统提示改动、一个动态时间戳,都会让缓存整段失效、全额重建。

详见:缓存是什么、如何控制避免大上下文反复重建缓存

3. 把"找上下文"的开销工程化掉

Agent 每次冷启动都要重新探索仓库:grep、ls、read……这些探索本身就在烧 token 和时间。成熟的做法是把可复用的知识沉淀到工件里:

  • CLAUDE.md / AGENTS.md:项目约定、构建命令、目录结构;
  • Skills:可按需加载的操作手册和脚本;
  • RepoPrompt 的 Codemap:把仓库结构压缩成签名级别的地图,替代逐文件通读。

快速导航

你想解决的问题去看
为什么中文比英文"费 token"?token 到底是什么?什么是 Tokenize
Fable 5、Opus 5、Sonnet、GPT-5.6 Sol/Terra/Luna 各适合干什么?思考强度怎么调?模型怎么选
200K 和 1M 上下文有什么区别?怎么在 Claude Code 里开 1M?上下文窗口与 1M
为什么我的 API 账单这么高?缓存怎么开?缓存是什么、如何控制
为什么缓存老是失效重建?避免反复重建缓存
装了一堆 MCP,上下文一开场就没了一小半?避免工具爆炸
探索类任务怎么不污染主对话?怎么并行分派?子代理
什么时候该 /compact、/clear?长任务怎么跨天续跑?会话生命周期
YOLO 模式安全吗?怎么防提示注入和密钥泄露?权限与安全
想把团队规范、部署流程固化给 Agent 用?用 Skills 辅助开发
有哪些值得装的现成 Skill?(Ponytail、ui-ux-pro-max、Impeccable)Skills 推荐
Agent 每次都重新翻半天代码才动手?用 RepoPrompt 降低开销

AI Coding Guideline — 面向 Claude Code / Codex 等 AI 编程工具的实践指南