← 总览
文章Matt Van Horn· 07-20 · 07:57

Fable 5 与 GPT-5.6 的过去七天:数千个赞揭示了哪些真正有效的方法

/last7days of Fable 5 and GPT-5.6: What Thousands of Upvotes Say Actually Works

打开原文

Fable 5 与 GPT-5.6 的过去七天:数千个赞揭示了哪些真正有效的方法

原文:*/last7days of Fable 5 and GPT-5.6: What Thousands of Upvotes Say Actually Works*
作者:Matt Van Horn (@mvanhorn)
发布时间:2026-07-15
互动数据:💬 7 🔁 12 ❤️ 120 🔖 253 👀 26720

---

cover

两个最新的前沿模型首次同时上线,而重叠窗口才刚满一周。不妨称之为 /last7days。本周,我用 /last30daysClaude Fable 5GPT-5.6 做了二十多次检索,每次聚焦一个角度:努力程度旋钮、过度提示、编排、成本、迁移误区,等等。返回的结果包括 Reddit 帖子、YouTube 解析、TikTok 视频、LinkedIn 帖子、GitHub issue 和 Hacker News 上的争论,全部来自人们真正同时上手这两个模型之后的短短几天。我读完了每一组内容。下面是最终真正经受住检验的十条实践,每一条都有真实用户的凭据,以及一段你今天就能直接粘贴使用的提示词。

这个窗口确实只有这么短。Fable 5 于 6 月 9 日发布,随后因出口管制经历了长达 19 天的停用,7 月 1 日才重新向所有人开放。GPT-5.6 于 7 月 9 日公开发布。写下这些文字时,两者的重叠期刚好进入第七天。就在这道狭窄的时间缝隙里,两家实验室都发布了提示词指南,而且最终落在了同一句话上:你的提示词写得太多了,停下来。

我每天都在使用这两个模型,所以开始调研之前自然已有一些看法。但社区里的观点更好,而且还带着赞同票数。

1. 🎯 告诉它目标。删掉步骤。

这个新时代最清晰的一句总结来自 TikTok,甚至比两家实验室发布各自的指南还要早。

大多数人使用 Fable 5 的方式完全错了。过度指示会让 Fable 5 的表现变差。不需要角色设定,不需要一步一步,不要说“展示你的推理过程”——这些全是在浪费 token。以目标为中心来写提示词:你想完成什么、相关背景是什么、哪些事情不能做、怎样才算完成。然后放手让它干活。

  • thinkwithv,TikTok,187 个赞

两份官方指南逐字印证了这一点。Anthropic 的 Fable 5 指南写道:“为以往模型开发的技能往往规定得过于细致,可能会降低 Claude Fable 5 的输出质量。”OpenAI 的 GPT-5.6 指南则建议:定义结果和完成标准,然后“为模型留出空间,让它自行选择高效的实现路径”。你在 GPT-5.5 和 Opus 时代精心编写的编号式操作手册,并不是毫无影响的历史包袱。它正在实实在在地让新模型变笨。

Anthropic 甚至直接给出了替代结构。现在,完整的提示词只需要这样:

我正在为[目标用户]处理[更大的任务]。他们需要[这份输出将帮助他们实现什么]。基于这些背景:[具体请求]。

2. ✂️ 每条指令只说一遍

OpenAI 用自己的指导原则跑了评测并公布了数据,X 上的一位开发者随即把它做成了本周最有用的一张截图。

精简的提示词胜过详尽的提示词。内部评测显示,删除重复指令后,得分提高了 10%~15%,同时 token 减少了 41%~66%,成本降低了 33%~67%。

  • @oliviscusAI,X,21 个赞

再读一遍:删掉文字,不仅让模型变得更聪明,还能让账单最多减少三分之二。指南给出的第二条警告,正是大多数生产环境提示词都会犯的问题:“相互冲突的规则可能比细节缺失造成更大的不稳定性。”任何已经使用了六个月的系统提示词里,几乎都藏着两条彼此悄然冲突的规则,而模型现在会花费推理 token,试图同时满足它们。修复只需要一个下午:删掉所有重复内容,删掉模型已不再需要的风格说明;保留成功标准和停止条件、所有涉及安全或权限的内容,以及你所要求的输出格式。然后通读剩余内容,找出其中的矛盾。

3. 🪆 让前沿模型指挥更便宜的模型

整个窗口期里获赞最多的实践并不是什么提示词技巧,而是一张组织架构图。

Anthropic 刚刚对“Fable 5 负责统筹,廉价模型负责执行”进行了基准测试:只花 46% 的成本,就能达到 96% 的性能。今天你就能在 Claude Code 中运行这种模式。

Theo 的 Fable 5 指南有 117,924 次观看,采用的是同一套打法:由 Fable 负责设计和审查,并直接告诉它,中间“基本上任何事情”都可以交给更便宜的模型处理。TikTok 上广泛流传的截图式操作手册把它称作顾问模式。Anthropic 的指南解释了为什么这种方法过去只能勉强奏效,如今却真正有效:Fable 5“在调度并维持多个并行子代理方面可靠得多”。下面这句编排者指令值得直接拿走:

把彼此独立的子任务委派给子 Agent,并在它们运行期间继续推进自己的工作。如果某个子 Agent 偏离方向或缺少相关上下文,及时介入。

4. 🥊 让两个模型打起来

这是我在整轮搜集里最喜欢的发现。r/ClaudeCode 上的一位开发者拒绝选边站,而是把前沿模型之间第一次真正的正面对决变成了一套常驻工作流。

我会把同一份问题描述和目标交给 Fable,以及开着 xhigh 的 Sol 5.6,让它们各自做设计。谁赢了,谁就负责执行自己的设计;输家则在各个检查点拆解这个方案,争取扳回一局。我还会让它们持续记分。

两个前沿模型,每个任务先比拼一次设计,输家则转任对抗性审查者。AI LABS 解析视频的评论区里,还出现了一种更温和的生产版本:由 Codex 承担大部分审查工作,最后再让 Fable 过一遍,因为它“经常能发现 Codex 审查时遗漏的问题”。无论采用哪种版本,原则都成立:你第一次有能力负担来自第二个前沿模型的意见,而取得最佳结果的人确实正在为此买单。

5. 💸 按每项任务的美元成本选择模型

关于基准测试的争论大约一天后就偃旗息鼓了。不断被引用的是成本,而最一针见血的评论谈的不是旗舰模型,而是中端模型。

Terra 只花 fable 四分之一的成本,就能和它打成平手 💀

证据很快便堆积起来。Sam Altman 表示,GPT-5.6 在代理式编码上的 token 效率提高了 54%Varun Mayya 的解析有 47,413 次观看,其中 Sol 仅用三分之一的 token,就达到了 Mythos 级别的输出。另一边,Fable 5 的输入费用为每百万 token 10 美元,输出费用为每百万 token 50 美元;一位 YouTuber 测出仅仅一条开场消息就要花费三四十美分,随后给视频起名为别再在 Claude Code 中使用 Fable 5 了(它正在拖你的后腿)。真正认真做事的人已经不会只选一个模型了。他们会写一张路由表:困难、耗时、模糊的工作交给前沿模型;其他只需要完成的事情,全部交给 Terra、Luna 或低努力程度的 Fable。

6. 🎚️ 努力程度旋钮可以调高,但不代表你应该这么做

现在,这两个模型都把思考强度做成了一个设置项。这个窗口期里最违反直觉的发现是:把它拉满通常是个错误。

在 Fable 5 上,调高[努力程度]其实是个巨坑。

Anthropic 的指南说得很明确:默认使用 high;只有对能力最敏感的工作才使用 xhigh;而且“Claude Fable 5 在较低努力程度设置下依然表现出色,甚至经常超过以往模型在 xhigh 下的表现”。OpenAI 对 GPT-5.6 推理级别的说法也一样:只有在“评测证明收益”的情况下,才应调到 high 以上。额外的努力程度不只会消耗更多金钱和时间,还会诱发过度打磨、未经要求的重构,以及没人要求它写的辅助工具。指南给出的应对指令可以直接粘贴:

不要添加任务未要求的功能,不要进行额外重构,也不要引入超出任务需要的抽象。修复一个 bug,不代表要顺手清理周边代码;一次性操作通常也不需要专门封装辅助函数。只在系统边界处进行校验,例如用户输入和外部 API。

7. 🗒️ 给它一本可以持续使用的笔记本

Anthropic 操作手册中传播最广的讲解,一开头就介绍了这条几乎没人试过的技巧;它也是这份清单中成本最低、收益却能不断复利的升级。

给 Fable 一个写笔记的地方。用一个简单的 Markdown 文件,让它记录每次运行中学到的东西:做过哪些修正、哪些方法有效、哪些无效。

一个 Markdown 文件,就能把一条金鱼变成一位同事。你今天做出的每一次纠正,都是下个月不必再做的纠正。以下内容直接来自指南:

每个文件只记录一条经验,并在文件顶部写一行摘要。既要记录纠正,也要记录已经验证有效的方法,包括它们为什么重要。不要保存代码仓库或聊天历史里已经存在的信息;如果相关笔记已经存在,就更新它,不要创建重复内容;后来发现错误的笔记应当删除。

8. 🧾 没有工具凭据,什么都别信

长时间运行是这两个模型的主打能力,而人们从惨痛教训中了解到的失败模式,是模型信心满满地汇报一项其实从未发生的进展。一位 Codex 用户这样描述真正值得信任的表现:

GPT-5.6 Sol 是第一个能够始终保持上下文、使用工具、检查自己的工作,并且无需照看就能把任务做完的模型。

  • @raul_rcl22,X,2 个赞

检查自身工作是一种需要由你安装进去的行为。它不会随着订阅免费附送。Anthropic 测试过一条指令,并报告称,即使任务被刻意设计成诱导模型编造进度,它也“几乎消除了虚假的状态报告”。一位 Reddit 老用户也根据实战经验给出了相同建议:“我总会让它在最后做一次对抗性审查。它每次都能发现错误”(jtmonkey,r/ChatGPT,125 个赞同)。这条指令是:

在汇报进展之前,逐项核查你的每一个声明,确认它有本次会话中的工具执行结果作为依据。只汇报那些能够指出证据的工作;如果某件事尚未验证,必须明确说明。

9. 🤐 永远不要让 Fable 5 展示推理过程

这是迁移过程中最容易被忽视的坑。Anthropic 的指南指出,在 Fable 5 上,要求模型“以回复文本的形式复述、转录或解释其内部推理”的提示词,可能会触发 reasoning_extraction 拒绝类别;一旦拒绝,你的请求会悄悄回退到 Claude Opus 4.8。你仍在为前沿模型付费,实际上却已经不再使用它。

你为旧版 Claude 写下的每一句“解释你的思考过程”“带我一步步了解你的推理”和“展示你的推导过程”,现在都成了地雷。用 grep 搜索你的技能和系统提示词,把它们全部删除。如果你需要查看推理,API 已经会返回结构化的思考块;直接读取这些内容,不要要求模型通过自我叙述把自己送进拒绝流程。

10. 🎛️ 设置一次详略程度旋钮,别再反复唠叨

新模型揭露出的最琐碎习惯,就是在每条提示词里都塞进一句“请简洁作答”——而规则 2 已经告诉你,这正是应该删除的重复指令。GPT-5.6 提供了 text.verbosity 设置,可选 low、medium 或 high,能够在 API 层一次性固定默认详略程度。Fable 5 对一条清晰易读的指令,执行效果要好过一叠反复提醒。社区用 Claude 窗口期里引用最多的一句话,解释了为什么值得专门优化简洁度。

如果 Sonnet 5 只用三分之一的输出,就能达到几乎与 Opus 4.8 相当的表现,那我举双手赞成。Opus 4.8 比一个猛灌糖浆的幼儿还能说。

旋钮只设置一次。指令只说一次。然后继续做事。

🧵 贯穿这十条实践的共同主线

把这十条并排放在一起,你会发现它们其实是同一条指令换了十套衣服:你的杠杆已经从提示词转移到了流程上。两家实验室在同样的两周内各自独立得出了相同结论,这已经是这个行业所能提供的最接近事实真相的东西。人们真正获得的收益,来自把正确的任务交给正确的模型并设置正确的努力程度,让前沿模型指挥更便宜的模型,强制要求所有状态报告都以证据为支撑,以及删掉旧提示词里一半的内容。而在这一切之下,还有一条让人清醒的结论,来自一位拥有四十年经验的老手,他在一段爆火的开发视频下写道:“AI 是最容易的部分。真正的工作是架构、调试、测试、安全、UI 和集成”(martyman1964,TikTok,115 个赞)。模型已经不再是瓶颈。现在,你才是那个变量。

🛠️ 可直接照搬的实战模式

过去两周的经验可以一次性归纳为以下做法:

  • 把一条旧提示词改写为目标、背景、边界和完成定义。删掉步骤。亲自比较输出结果。
  • 审查你最长的系统提示词,找出重复和矛盾。OpenAI 的评测结果表明,这次清理能以最高减少 67% 成本的代价,换来 10%~15% 的质量提升。
  • 在 Claude Code 中运行编排者模式:Fable 负责规划和审查,廉价模型负责执行。达到 96% 的性能,只需 46% 的成本。
  • 面对任何困难任务,都把同一个目标交给开着 xhigh 的 Fable 和 Sol;采用胜者的设计,并让败者在各个检查点负责审查。
  • 默认把努力程度保持在 high。把常规工作交给 Terra、Luna 或低努力程度模式。只把 xhigh 和 max 留给真正配得上它们的问题。
  • 给模型一个笔记文件;在它声称取得任何进展之前,要求它提供工具凭据审计;再用 grep 搜索 Fable 提示词中的“展示你的推理过程”,删除所有匹配项。

📊 所有代理均已返回结果

本文汇总了二十多次 /last30days 运行结果,来源覆盖 Reddit、X、YouTube、TikTok、Instagram、LinkedIn、Hacker News、GitHub 和 Digg,涵盖了 Fable 5 恢复上线后的两周,以及 GPT-5.6 公开发布后的六天。最强烈的信号:编排者基准测试,1,246 个赞同。最犀利的工作流:Fable 对阵 Sol 的设计比拼,302 个赞同。最干净利落的论点:thinkwithv 提出的目标导向式提示,187 个赞。最硬的凭据:OpenAI 自己的数据表明,减少 41%~66% 的 token,能带来 10%~15% 的质量提升。最具代表性的声音:SpaceCowboy077、thinkwithv、raycfu、ethotopia、@oliviscusAI;r/ClaudeAI、r/ClaudeCode、r/OpenAI。

这篇文章是大量搜索和一个下午阅读的成果。我没有采访任何人。引文是真实的,凭据是真实的,你也可以亲自运行同样的查询。可直接使用的提示词均来自两份官方指南。社区和模型开发者在同一周共同写出了这份操作手册;我只是把它们整理到了一起。