AI Coding Guideline
本指南面向 Claude Code、Codex 给出可落地实践,说明聊天问答与自主工具调用的本质差别,以及上下文、缓存和工程化如何决定速度、成本与质量
面向 Claude Code、Codex 等 AI 编程工具的实践指南。聊天是一问一答;编程 Agent 会在一轮任务里自主执行几十上百次工具调用。决定速度、成本和质量的,不是提示词写得妙不妙,而是上下文、缓存,以及把“找上下文”的开销工程化掉。
指南从哪里读起
上下文窗口
理解 200K 与 1M 上下文的真实区别,以及在 Claude Code 中如何用 /model claude-opus-5[1m] 开启 1M 模式。
Prompt 缓存
缓存是什么、怎么控制、为什么大上下文会反复重建缓存,以及如何把成本降到 1/10。
工具与上下文管理
MCP 工具装太多会“工具爆炸”撑爆上下文——如何按需加载、精简工具集。
Skills 辅助开发
用渐进式加载的 Skills 把团队经验固化成可复用的工作流,而不占用常驻上下文。
Skills 推荐
社区验证过的第三方 Skill Ponytail,治“AI 味”前端的 ui-ux-pro-max 与 Impeccable。
Tokenize 原理
什么是 token、中英文的 token 差异、为什么它决定了你的成本和上下文预算。
模型选择与思考强度
Claude Fable 5 / Opus / Sonnet 与 GPT-5.6 Sol / Terra / Luna 各适合什么任务,effort 与 thinking budget 怎么用。
RepoPrompt
用 Codemap 和上下文预构建,避免 Agent 每一轮都重新 grep 找文件。
三件更底层的事
- 上下文是稀缺资源。 系统提示、工具定义、CLAUDE.md、每一次文件读取、每一条命令输出,全都在消耗窗口。详见 什么是 Tokenize、上下文窗口与 1M、避免工具爆炸。
- 缓存决定了成本和速度。 Agent 的每一轮请求都会把整个对话历史重新发给模型。Prompt Caching 让前缀不变的部分以 1/10 的价格命中,前提是不破坏前缀。详见 缓存是什么、如何控制、避免大上下文反复重建缓存。
- 把“找上下文”的开销工程化掉。 把可复用知识沉淀到
CLAUDE.md/AGENTS.md、Skills 和 RepoPrompt 的 Codemap。