Appearance
总览:AI 编程的核心心智模型
用 Claude Code、Codex(OpenAI 的编程 Agent)、Cursor 这类工具写代码,和"跟 ChatGPT 聊天"是两件完全不同的事。聊天是一问一答;而编程 Agent 会在一轮任务里自主执行几十上百次工具调用——读文件、跑命令、改代码、看测试输出——每一步的输入输出都会累积进同一个上下文窗口。
因此,决定你使用体验(速度、成本、质量)的,不是"提示词写得妙不妙",而是三件更底层的事:
1. 上下文是稀缺资源
模型的上下文窗口(200K 或 1M token)是 Agent 的"工作记忆"。系统提示、工具定义、CLAUDE.md、每一次文件读取、每一条命令输出,全都在消耗它。上下文被塞满后:
- 模型开始"遗忘"早期的指令和约定,输出质量下降(context rot);
- 触发压缩(compact)或截断,丢失细节;
- 每一轮请求都变得更慢、更贵。
所以本指南的大量篇幅都在讲怎么省着用上下文:理解 token、理解窗口大小、避免工具爆炸、用 Skills 按需加载、用 RepoPrompt 预构建上下文。
2. 缓存决定了成本和速度
Agent 的每一轮请求都会把整个对话历史重新发给模型。没有缓存的话,一个 100 轮的任务要把开头的内容重复计费 100 次。Prompt Caching 让"前缀不变的部分"以 1/10 的价格命中缓存——但前提是你不破坏前缀。一次不经意的系统提示改动、一个动态时间戳,都会让缓存整段失效、全额重建。
3. 把"找上下文"的开销工程化掉
Agent 每次冷启动都要重新探索仓库:grep、ls、read……这些探索本身就在烧 token 和时间。成熟的做法是把可复用的知识沉淀到工件里:
CLAUDE.md/AGENTS.md:项目约定、构建命令、目录结构;- Skills:可按需加载的操作手册和脚本;
- RepoPrompt 的 Codemap:把仓库结构压缩成签名级别的地图,替代逐文件通读。
快速导航
| 你想解决的问题 | 去看 |
|---|---|
| 为什么中文比英文"费 token"?token 到底是什么? | 什么是 Tokenize |
| Fable 5、Opus 5、Sonnet、GPT-5.6 Sol/Terra/Luna 各适合干什么?思考强度怎么调? | 模型怎么选 |
| 200K 和 1M 上下文有什么区别?怎么在 Claude Code 里开 1M? | 上下文窗口与 1M |
| 为什么我的 API 账单这么高?缓存怎么开? | 缓存是什么、如何控制 |
| 为什么缓存老是失效重建? | 避免反复重建缓存 |
| 装了一堆 MCP,上下文一开场就没了一小半? | 避免工具爆炸 |
| 探索类任务怎么不污染主对话?怎么并行分派? | 子代理 |
| 什么时候该 /compact、/clear?长任务怎么跨天续跑? | 会话生命周期 |
| YOLO 模式安全吗?怎么防提示注入和密钥泄露? | 权限与安全 |
| 想把团队规范、部署流程固化给 Agent 用? | 用 Skills 辅助开发 |
| 有哪些值得装的现成 Skill?(Ponytail、ui-ux-pro-max、Impeccable) | Skills 推荐 |
| Agent 每次都重新翻半天代码才动手? | 用 RepoPrompt 降低开销 |