Claude 提示词审计:成本降 14.6%,准确率升 5.3%

Anthropic2026年9月8日 约 8 分钟

2026-09-08,Anthropic 发布 Claude Platform 成本优化方法,称通过提示缓存、清理旧提示词反模式、校准 effort,可在官方测试中降低成本同时保持或提升性能;其中 Claude Code 的 prompt-audit 在客服基准平均降本 14.6%、准确率提升 5.3%。

AnthropicClaudeClaude API提示工程模型评测
一分钟速览
  1. Anthropic 把 Claude API 降本拆成缓存、清提示词、校准 effort 三件事,并交给 Claude Code 自动审计。
  2. 旧模型时代写的保险式提示词,可能让新模型多调工具、多写推理,清理后反而更准更便宜。
  3. 数字来自 Anthropic 官方基准和 Claude Code 测试,覆盖客服、代码、法律等任务,不等于所有应用。

一句“再检查一遍”,让客服模型多查了订单

客服工单里,模型被要求 verify twice 后,每次退款都会重复查订单;被要求 be maximally thorough 后,它又做了几十次知识库搜索。2026-09-08,Anthropic 发布 Claude Platform 成本优化方法,指出这类为旧模型写的保险指令,在升级到 Claude Opus 5 等前沿模型后,会被模型当成真实任务执行,推高 token 和工具调用。Anthropic 在客服基准测试中给出,用 Claude Code 的 /claude-apiprompt-auditprompt-auditClaude Code 中的提示词审计命令,用来扫描 prompts、skills、tool descriptions、应用代码和 CLAUDE.md 等项目配置,找出可能拖慢或增加成本的旧写法。通俗理解像给提示词做一次代码 lint。清理六类旧提示词后,平均成本下降 14.6%,准确率提升 5.3%。

这组数字之所以值得看,是因为它打破了常见直觉:降本不一定要牺牲性能。Anthropic 把原因归到三处:重复计算、旧提示词补丁、efforteffort告诉模型“多用力”的设置。低 effort 更快,高 effort 更多推理、验证和探索。通俗理解像给模型选择“快速作答”还是“深度检查”。错配。三者都会让模型做任务本身不需要的工作。对刚开始接入 Claude API 的人来说,关键不是先问“能不能换个更便宜的模型”,而是先问“模型现在到底在为什么花钱”。

Claude Blog rendered article heroReducing cost and improving performance with Claude Platform

Claude 的贵,先从重复计算开始

Claude 处理输入时,最贵的一步不是生成答案,而是prefillprefill模型在生成答案前处理输入、建立内部工作状态的过程,是输入成本的主要来源。通俗理解像读完整份材料再开始答题。:把 prompt 读成内部工作状态。Prompt cache 保存这个状态,也就是 key-value cache。下一次请求如果开头逐字节相同、模型相同、缓存未过期,Claude 直接读回状态,按远低于完整输入的价格计费。缓存命中省的是重复计算;缓存未命中则要把前缀重新算一遍。

缓存失效往往来自小改动。系统提示词里的动态时间戳、工具定义重排、中途改变 effort 或 thinking、子代理超过缓存TTLTTL缓存有效期。超过 TTL 后,缓存状态过期,需要重新计算。通俗理解像临时通行证,过期就要重新办。,都会让前缀不再一致。Anthropic 特别提到,Claude Opus 5 和 Claude Fable 5.1 可以在会话中更新 effort 而不破坏缓存;其他情况下,effort 和 thinking 设置会渲染到内容前面,属于缓存前缀的一部分。子代理或分支也只有在同一模型、同一 effort、前缀逐字节相同时,才共享父级缓存。

Anthropic 给出的修复是把稳定部分放前面:工具定义和系统提示词先写,不断增长的对话追加在后面。少用工具可以标记 defer_loading,让它们先不进入缓存前缀,等 tool search 再追加。系统指令更新尽量作为消息加入,而不是改系统提示词。Claude Console 可以比较相邻请求,指出前缀在哪里分叉。对于长会话,还可以用 max_tokens: 0 预热缓存,或在 compaction 这类本来就要重写缓存的时刻切换模型和 effort。

时间也很关键。Anthropic 称,5 分钟缓存 TTL 从请求开始计时;如果代理阻塞在长工具调用或子代理上,缓存可能先过期。下一轮要按正常输入价 1.25 倍重写,1 小时缓存为 2 倍。缓存命中能省重复计算,但它不能替提示词瘦身,也不能决定模型该思考多深。

原文素材Figure 1. Claude Console can diagnose unexpected prompt cache misses by comparing consecutive requests and identifying exactly where the prompt prefix diverged.
原文素材Figure 2. Organize prompts to ensure dynamic content is appended to the end of a stable prefix.

旧提示词的保险,成了新模型的额外任务

旧提示词的问题在于,它们常常是为旧模型的弱点写的补丁。double-check your work、CRITICAL: YOU MUST ALWAYS…、固定scratchpadscratchpad提示词要求模型在固定草稿区逐步推理。旧模型可能需要,前沿模型已有内置思考,额外草稿可能冲突。通俗理解像给自动洗衣机再贴一张手洗步骤。、过时 thinking 设置、互相冲突的规则,在前沿模型上可能被更字面地执行。Anthropic 把这些称为 promptinganti-patternanti-pattern过去为旧模型弱点写的补丁式提示词,在新模型上可能变成多余验证、多余工具调用或冲突指令。通俗理解像旧伤口上的绷带,伤口好了还继续缠着。s。它们不一定让模型变笨,反而可能让模型太认真地执行已经不必要的流程。

客服基准测试从干净提示词出发,每次植入一个反模式,得到六份旧提示词:过时 thinking 设置、冲突退款规则、手工 scratchpad、verify twice、be maximally thorough、强制六步流程。它们先在 Claude Opus 4.8 上运行,再只改模型 ID 到 Claude Opus 5,最后每份跑一次 /claude-api prompt-audit。平均结果是成本下降 14.6%,准确率提升 5.3%。

准确率上升不是因为模型突然变强,而是旧补丁制造了错误。过时 thinking 设置让 API 拒绝每个路由请求;冲突退款规则让 Claude Opus 5 该退 4 单却要求客户确认;手工 scratchpad 与内置思考冲突,三次把工具调用写进推理里却没有执行。verify twice 让每次退款都重复查订单;be maximally thorough 变成几十次知识库搜索。清理这些补丁,减少的是多余工具调用和重复推理。

这是 Anthropic 官方客服基准,六类反模式平均。它说明旧提示词可能同时推高成本并拉低准确率,但不能外推到所有提示词。真正稳妥的做法是保留评测集,比较清理前后的成本、准确率和失败样本。

原文素材Figure 3. The effect of prompting anti-patterns during model migration from Opus 4.8 to Opus 5.
原文素材Figure 4. Fable 5 performance vs cost across effort levels on FrontierCode Diamond.

effort 不是越高越好,也不是越低越省

Effort 控制模型“多用力”。低 effort 更快,高 effort 会更多推理、验证和探索。Anthropic 给出的 Claude Fable 5 数据说明,effort 可以买性能,但价格不线性:在 FrontierCode Diamond 最难 50 题代码基准上,低 effort 得分 11.5%,每题 5.35 美元;max effort 得分 30.9%,每题 19.00 美元。分数约 2.7 倍,成本约 3.5 倍。

另一组数据说明高 effort 也可能白花钱。Claude Fable 5.1 在 Humanity's Last Exam 无工具设置下,低 effort 约 53%,每题约 0.30 美元;max effort 约 61%,每题约 2.23 美元。最后一步只增加约半分,成本却多 46%,且落在运行噪声内。CursorBench 3.2 编码基准上,Claude Fable 5.1 低 effort 匹配 Claude Fable 5 高 effort,成本约三分之一;部分原因是 Fable 5.1 缓存读取价 0.25 美元/百万 token,低于 Fable 5 的 1.00 美元。

Anthropic 的hillclimbhillclimbClaude Code 中的迭代搜索命令,给定评测集后拆分训练集和测试集,读取失败样本并提出模型、effort、提示词配置。通俗理解像根据错题本反复调整复习策略。测试把模型、effort 和提示词一起搜索。它把评测拆成训练集和测试集,读取失败样本并提出配置。从 Claude Opus 4.8 默认高 effort 开始,先试 Claude Opus 5 低 effort 并清理反模式,训练集准确率 98.9%,每张工单成本 2.6 美分;再降到 Claude Sonnet 5 低 effort,成本 1 美分但准确率掉到 88.9%。补上路由规则和退款上限交叉引用后,Sonnet 5 回到 98.9%,成本不变。在 14 个未参与搜索的held-outheld-out未参与配置搜索的测试样本,用来检查最终配置是否过拟合训练样本。通俗理解像模拟考没见过的真题。工单上,最终配置 90.5%,原配置 78.6%,成本约五分之一。

effort 错配有两个方向。高 effort 可能过度思考,增加延迟和成本,甚至让答案变差;低 effort 可能证据不足,少调工具,只根据第一次搜索结果回答。Anthropic 建议对关键任务做effort sweepeffort sweep在多个 effort 档位上测试同一任务,观察得分和成本如何变化。通俗理解像把油门从低到高踩一遍,看速度是否真的提升。:如果性能和成本曲线很平,说明任务不是被思考算力卡住,增加 effort 未必有用。

原文素材Figure 5. Fable 5 vs. Fable 5.1 across effort levels on CursorBench 3.2.
原文素材Figure 6. Hillclimbing improves cost and performance by updating model choice, effort, and prompt.

先审计、再优化、最后搜索:Claude Code 的三步

三个动作可以按顺序落地。刚迁移到前沿模型,先跑 /claude-api prompt-audit,扫描 prompts、skills、tool descriptions、应用代码和 CLAUDE.md 等项目配置。已有 Claude API 应用,用 /claude-apicost-optimizecost-optimizeClaude Code 中的成本审计命令,用来定位 token 花费,并测试缓存、请求裁剪、输出上限、批处理等节省方式。通俗理解像自动找账单里的大头支出。定位 token 花费:优先看用量报告、API usage 对象,或读取请求构建代码估算。它按提示缓存、请求内容、输出上限、批处理排序节省项;有评测集时再比较 effort 和模型。

Anthropic 在四个公开基准上从 Claude Sonnet 5 基线测试 cost-optimize:LegalBench 成本约降 58%,thinking tokensthinking tokens模型内部推理消耗的 token。减少 thinking tokens 可能降低成本,但不一定改变最终通过率。通俗理解像草稿纸用量,草稿少不一定代表答案更差。从 102,779 降到 8,284,通过率在噪声内;tau2-bench retail 成本约降 73%,通过率持平;OfficeQA Pro 成本从 136.20 美元降到 64.87 美元;SWE-bench Verified 成本约降 55%,中位步骤数从 29 降到 17,输入 token 数从 75.2M 降到 33.7M。

这些命令能自动找浪费,但不能替业务定义好坏。LegalBench 的通过率在噪声内,说明降本可能不改变质量;SWE-bench 的节省来自把 effort 调到 medium,并把输出限制为几句简洁句子,若任务需要长链路探索,就不能照搬。真正可复用的判断是:先让缓存命中,再删掉旧模型补丁,最后用评测集校准 effort 和模型。

原文素材Figure 7. Cost and performance change across benchmarks with /claude-api cost-optimize.