一句“再检查一遍”,让客服模型多查了订单
客服工单里,模型被要求 verify twice 后,每次退款都会重复查订单;被要求 be maximally thorough 后,它又做了几十次知识库搜索。2026-09-08,Anthropic 发布 Claude Platform 成本优化方法,指出这类为旧模型写的保险指令,在升级到 Claude Opus 5 等前沿模型后,会被模型当成真实任务执行,推高 token 和工具调用。Anthropic 在客服基准测试中给出,用 Claude Code 的 /claude-apiprompt-auditprompt-auditClaude Code 中的提示词审计命令,用来扫描 prompts、skills、tool descriptions、应用代码和 CLAUDE.md 等项目配置,找出可能拖慢或增加成本的旧写法。通俗理解像给提示词做一次代码 lint。清理六类旧提示词后,平均成本下降 14.6%,准确率提升 5.3%。
这组数字之所以值得看,是因为它打破了常见直觉:降本不一定要牺牲性能。Anthropic 把原因归到三处:重复计算、旧提示词补丁、efforteffort告诉模型“多用力”的设置。低 effort 更快,高 effort 更多推理、验证和探索。通俗理解像给模型选择“快速作答”还是“深度检查”。错配。三者都会让模型做任务本身不需要的工作。对刚开始接入 Claude API 的人来说,关键不是先问“能不能换个更便宜的模型”,而是先问“模型现在到底在为什么花钱”。
Claude 的贵,先从重复计算开始
Claude 处理输入时,最贵的一步不是生成答案,而是prefillprefill模型在生成答案前处理输入、建立内部工作状态的过程,是输入成本的主要来源。通俗理解像读完整份材料再开始答题。:把 prompt 读成内部工作状态。Prompt cache 保存这个状态,也就是 key-value cache。下一次请求如果开头逐字节相同、模型相同、缓存未过期,Claude 直接读回状态,按远低于完整输入的价格计费。缓存命中省的是重复计算;缓存未命中则要把前缀重新算一遍。
缓存失效往往来自小改动。系统提示词里的动态时间戳、工具定义重排、中途改变 effort 或 thinking、子代理超过缓存TTLTTL缓存有效期。超过 TTL 后,缓存状态过期,需要重新计算。通俗理解像临时通行证,过期就要重新办。,都会让前缀不再一致。Anthropic 特别提到,Claude Opus 5 和 Claude Fable 5.1 可以在会话中更新 effort 而不破坏缓存;其他情况下,effort 和 thinking 设置会渲染到内容前面,属于缓存前缀的一部分。子代理或分支也只有在同一模型、同一 effort、前缀逐字节相同时,才共享父级缓存。
Anthropic 给出的修复是把稳定部分放前面:工具定义和系统提示词先写,不断增长的对话追加在后面。少用工具可以标记 defer_loading,让它们先不进入缓存前缀,等 tool search 再追加。系统指令更新尽量作为消息加入,而不是改系统提示词。Claude Console 可以比较相邻请求,指出前缀在哪里分叉。对于长会话,还可以用 max_tokens: 0 预热缓存,或在 compaction 这类本来就要重写缓存的时刻切换模型和 effort。
时间也很关键。Anthropic 称,5 分钟缓存 TTL 从请求开始计时;如果代理阻塞在长工具调用或子代理上,缓存可能先过期。下一轮要按正常输入价 1.25 倍重写,1 小时缓存为 2 倍。缓存命中能省重复计算,但它不能替提示词瘦身,也不能决定模型该思考多深。
旧提示词的保险,成了新模型的额外任务
旧提示词的问题在于,它们常常是为旧模型的弱点写的补丁。double-check your work、CRITICAL: YOU MUST ALWAYS…、固定scratchpadscratchpad提示词要求模型在固定草稿区逐步推理。旧模型可能需要,前沿模型已有内置思考,额外草稿可能冲突。通俗理解像给自动洗衣机再贴一张手洗步骤。、过时 thinking 设置、互相冲突的规则,在前沿模型上可能被更字面地执行。Anthropic 把这些称为 promptinganti-patternanti-pattern过去为旧模型弱点写的补丁式提示词,在新模型上可能变成多余验证、多余工具调用或冲突指令。通俗理解像旧伤口上的绷带,伤口好了还继续缠着。s。它们不一定让模型变笨,反而可能让模型太认真地执行已经不必要的流程。
客服基准测试从干净提示词出发,每次植入一个反模式,得到六份旧提示词:过时 thinking 设置、冲突退款规则、手工 scratchpad、verify twice、be maximally thorough、强制六步流程。它们先在 Claude Opus 4.8 上运行,再只改模型 ID 到 Claude Opus 5,最后每份跑一次 /claude-api prompt-audit。平均结果是成本下降 14.6%,准确率提升 5.3%。
准确率上升不是因为模型突然变强,而是旧补丁制造了错误。过时 thinking 设置让 API 拒绝每个路由请求;冲突退款规则让 Claude Opus 5 该退 4 单却要求客户确认;手工 scratchpad 与内置思考冲突,三次把工具调用写进推理里却没有执行。verify twice 让每次退款都重复查订单;be maximally thorough 变成几十次知识库搜索。清理这些补丁,减少的是多余工具调用和重复推理。
这是 Anthropic 官方客服基准,六类反模式平均。它说明旧提示词可能同时推高成本并拉低准确率,但不能外推到所有提示词。真正稳妥的做法是保留评测集,比较清理前后的成本、准确率和失败样本。
effort 不是越高越好,也不是越低越省
Effort 控制模型“多用力”。低 effort 更快,高 effort 会更多推理、验证和探索。Anthropic 给出的 Claude Fable 5 数据说明,effort 可以买性能,但价格不线性:在 FrontierCode Diamond 最难 50 题代码基准上,低 effort 得分 11.5%,每题 5.35 美元;max effort 得分 30.9%,每题 19.00 美元。分数约 2.7 倍,成本约 3.5 倍。
另一组数据说明高 effort 也可能白花钱。Claude Fable 5.1 在 Humanity's Last Exam 无工具设置下,低 effort 约 53%,每题约 0.30 美元;max effort 约 61%,每题约 2.23 美元。最后一步只增加约半分,成本却多 46%,且落在运行噪声内。CursorBench 3.2 编码基准上,Claude Fable 5.1 低 effort 匹配 Claude Fable 5 高 effort,成本约三分之一;部分原因是 Fable 5.1 缓存读取价 0.25 美元/百万 token,低于 Fable 5 的 1.00 美元。
Anthropic 的hillclimbhillclimbClaude Code 中的迭代搜索命令,给定评测集后拆分训练集和测试集,读取失败样本并提出模型、effort、提示词配置。通俗理解像根据错题本反复调整复习策略。测试把模型、effort 和提示词一起搜索。它把评测拆成训练集和测试集,读取失败样本并提出配置。从 Claude Opus 4.8 默认高 effort 开始,先试 Claude Opus 5 低 effort 并清理反模式,训练集准确率 98.9%,每张工单成本 2.6 美分;再降到 Claude Sonnet 5 低 effort,成本 1 美分但准确率掉到 88.9%。补上路由规则和退款上限交叉引用后,Sonnet 5 回到 98.9%,成本不变。在 14 个未参与搜索的held-outheld-out未参与配置搜索的测试样本,用来检查最终配置是否过拟合训练样本。通俗理解像模拟考没见过的真题。工单上,最终配置 90.5%,原配置 78.6%,成本约五分之一。
effort 错配有两个方向。高 effort 可能过度思考,增加延迟和成本,甚至让答案变差;低 effort 可能证据不足,少调工具,只根据第一次搜索结果回答。Anthropic 建议对关键任务做effort sweepeffort sweep在多个 effort 档位上测试同一任务,观察得分和成本如何变化。通俗理解像把油门从低到高踩一遍,看速度是否真的提升。:如果性能和成本曲线很平,说明任务不是被思考算力卡住,增加 effort 未必有用。
先审计、再优化、最后搜索:Claude Code 的三步
三个动作可以按顺序落地。刚迁移到前沿模型,先跑 /claude-api prompt-audit,扫描 prompts、skills、tool descriptions、应用代码和 CLAUDE.md 等项目配置。已有 Claude API 应用,用 /claude-apicost-optimizecost-optimizeClaude Code 中的成本审计命令,用来定位 token 花费,并测试缓存、请求裁剪、输出上限、批处理等节省方式。通俗理解像自动找账单里的大头支出。定位 token 花费:优先看用量报告、API usage 对象,或读取请求构建代码估算。它按提示缓存、请求内容、输出上限、批处理排序节省项;有评测集时再比较 effort 和模型。
Anthropic 在四个公开基准上从 Claude Sonnet 5 基线测试 cost-optimize:LegalBench 成本约降 58%,thinking tokensthinking tokens模型内部推理消耗的 token。减少 thinking tokens 可能降低成本,但不一定改变最终通过率。通俗理解像草稿纸用量,草稿少不一定代表答案更差。从 102,779 降到 8,284,通过率在噪声内;tau2-bench retail 成本约降 73%,通过率持平;OfficeQA Pro 成本从 136.20 美元降到 64.87 美元;SWE-bench Verified 成本约降 55%,中位步骤数从 29 降到 17,输入 token 数从 75.2M 降到 33.7M。
这些命令能自动找浪费,但不能替业务定义好坏。LegalBench 的通过率在噪声内,说明降本可能不改变质量;SWE-bench 的节省来自把 effort 调到 medium,并把输出限制为几句简洁句子,若任务需要长链路探索,就不能照搬。真正可复用的判断是:先让缓存命中,再删掉旧模型补丁,最后用评测集校准 effort 和模型。




