Think harder:提示词和 reasoning 档位是怎么互相作用的
Think harder: how prompts interact with reasoning options
Think harder:提示词和 reasoning 档位是怎么互相作用的
原文:Think harder: how prompts interact with reasoning options
*文章封面图:Think harder — 提示词与推理选项的交互*
现在每家厂商都给了你一个 effort 旋钮。low、medium、high、xhigh、max、adaptive、ultra,随便挑。
我一直以为这就是控制 reasoning effort(推理投入档位)的主要手段,甚至是唯一手段。毕竟这肯定比嘴上说一句「think hard」管用得多吧?提示词工程(prompt engineering)不都是 2025 年的老话题了吗。
我现在要说的是:prompt engineering 活得好好的。在 low 档位上加一句「think hard」,效果可以超过把 reasoning 直接调到 high。
TL;DR
在 Opus 5 上,reasoning 设为 low,然后加一条写着「think hard」的 user message,total tokens 涨了 66%,从 424 涨到 704。这比不加提示词、直接把 Opus 5 设成 high 还要多 —— 后者只用了 662。
OpenAI 的模型也一样。在 Sol 上,low +「think hard」用掉 320 个 total tokens,比什么都不加的 max 基线(283)还高。
觉得只看 total tokens 不够说服力?那就看服务方直接上报的 reasoning tokens:在 Sol 上,low +「think hard」把 reasoning tokens 从 60 推到 114,刚好超过什么都不加的 high 基线 113。
我承认这个实验多少有点刻意设计,但它非常容易复现。
实验怎么做的
我用了三道「简单」数学题:
- 「单词 MISSISSIPPI 的字母有多少种不同的排列方式?」*(34,650)*
- 「你反复抛一枚均匀硬币,第一次出现 HTH 这个序列时,期望的抛掷次数是多少?」*(10)*
- 「把 8 个完全相同的球放进 4 个可区分的盒子里,且每个盒子都不能空,有多少种放法?」*(35)*
以及两条一字不改的提示词:
"Think hard about this problem. Be thorough and check your work carefully."(认真思考这个问题,仔细彻底地检查你的解答。)
"Keep your reasoning brief."(推理简短一点。)
然后每个请求我都测了五个版本:
- 不加任何额外指令
- 「think hard」放在 user prompt 里
- 「think hard」放在 system prompt 里
- 「keep brief」放在 user prompt 里
- 「keep brief」放在 system prompt 里
结果
厂商给的 effort 参数确实有用。但提示词里的那几个字,往往更有用。
「think hard」通常会把 token 用量顶上去,「keep your reasoning brief」通常会把它压下来。哪怕 effort 已经被显式设成 low、high、xhigh 或 max,这件事照样发生。
Sol 上这一点特别明显。low 档位下,user 里的「think hard」把总用量从 212 推到 320;max 档位下,从 283 推到 422。
Prompt-Effort 矩阵
*GPT-5.6 Sol 在不同 reasoning effort 档位与提示词放置位置下,服务方上报的 reasoning tokens 矩阵*
在 Sol 上,low + user「think hard」达到 114 个 reasoning tokens,刚好超过什么都不加的 high 基线 113。在 max 档位下,reasoning tokens 从 144 涨到 210。
下面是 Opus 的 total tokens:
*Claude Opus 5 在不同 reasoning effort 档位与提示词放置位置下的平均 total tokens 矩阵*
Opus 这边我用的是「平均 total tokens」,因为一旦被要求想得更用力,Opus 尤其容易把更多推理内容直接写进正式输出里。在 low 档位下,user 里的「think hard」让 total tokens 涨了 66%,从 424 到 704 —— 比不加提示词的 high(662)还多。reasoning tokens 本身也涨了 28%,从 42 到 54。
*Claude Opus 5 在不同 reasoning effort 档位与提示词放置位置下的平均 reasoning tokens 矩阵*
user prompt 还是 system prompt?
user prompt 更管用。26 个「模型 × effort 档位」组合里,有 23 个都是 user prompt 版的「think hard」消耗了更多 total tokens;user prompt 版的「keep brief」则在 26 个里有 22 个消耗更少。
Claude 也是同样的规律。Sonnet 4.6 在 high 档位下,「think hard」放 user 里冲到 1,383 tokens,放 system 里只有 1,120。「keep brief」放 user 里掉到 552,放 system 里是 805。
我的意思是……
如果你在意成本,别指望 reasoning effort 能替你兜住。它只是改了默认值,用户随时能覆盖掉它。
完整表格
OpenAI
*OpenAI 模型完整 total-token 表格:Sol 在前,随后是 Terra 与 Luna*
Claude
*Claude 模型完整 total-token 表格:Opus 5 在前,随后是 Sonnet 4.6*