笔者在日常工作支持中使用 Claude,但若将顶级模型 Claude Fable 5 作为常用模型,会惊讶于 token 消耗之快。调查之后发现,这并非靠使用技巧就能解决的问题,而是价格结构的问题;同时也了解到,Anthropic 自身已连同实测数据一起给出了两种应对配置。本文先给出结论,再根据官方文档与官方发布,梳理作为依据的价格结构、两种策略的机制与实测数据、采用手段的现状,以及“当下的现实之选是哪一种”。

结论 —— 不常用 Fable 5,而以节约配置使用。当下的现实之选是策略 A

将 Fable 5 作为主模型持续撰写产出的用法,正如下一章所示,无论在 API 计费还是订阅方式下都难以持续。作为替代,Anthropic 面向开发者的官方账号 @ClaudeDevs 在 2026 年 7 月 8 日的一条帖子串中给出了以下两种配置。

配置角色分工官方实测数据
策略 A:advisor 配置Sonnet 5 执行,Fable 5 在关键处提供建议以约 63% 的价格达到 Fable 5 单体约 92% 的分数(SWE-bench Pro)
策略 B:orchestrator 配置Fable 5 规划、指挥,Sonnet 5 worker 执行以 46% 的价格达到 Fable 5 单体 96% 的性能(BrowseComp)

两者共通的原则是“不让昂贵的模型产出 token“。产出物、大量调查结果等占用 token 较多的输出交给廉价的 Sonnet 5,而 Fable 5 的登场则限定于简短的建议,或规划与指挥。

不过,两种配置在采用的便捷程度上完全不同。策略 A 可以用一条 Claude Code 命令启用,而运行策略 B 的手段在目前仅限于测试版提供的 API 功能或自行搭建(后述)。因此本文的结论是“当下的现实之选是策略 A“。

为何昂贵 —— 单价是 Opus 4.8 的两倍,token 数也增加约 30%

根据 Anthropic 的官方价格表,主要模型的 API 价格(每百万 token)如下。

模型输入输出
Claude Fable 5$10$50
Claude Opus 4.8$5$25
Claude Sonnet 5 ※$2$10
Claude Sonnet 4.6$3$15

※ Sonnet 5 为截至 2026 年 8 月 31 日的导入价格。自同年 9 月 1 日起,将变为与 Sonnet 4.6 相同的输入 $3、输出 $15。

无论输入还是输出,Fable 5 都恰为 Opus 4.8 的两倍,与导入价格的 Sonnet 5 相比则为五倍。

此外,还有一个容易被忽视的点:同一价格页面附有以下注记。

Claude Opus 4.7 and later Opus models, Claude Fable 5, Claude Mythos 5, Claude Mythos Preview, and Claude Sonnet 5 use a newer tokenizer that contributes to their improved performance on a wide range of tasks. This tokenizer produces approximately 30% more tokens for the same text.

(Opus 4.7 及之后的 Opus 模型、Fable 5、Sonnet 5 等采用了有助于在广泛任务上提升性能的新分词器,对于相同的文本会生成约 30% 更多的 token。)

也就是说,Fable 5 不仅单价高,对于同一项工作所计入的 token 数本身也比旧世代模型更多。以订阅方式(Pro/Max)使用 Claude Code 时,这一消耗也会计入方案的使用上限(usage limit)(Claude Code 的文档中也明确指出,后述 advisor 的使用量会计入使用上限),因此将 Fable 5 常时作为主模型运行的用法,无论在 API 计费还是订阅方式下都难以持续。

策略 A —— Sonnet 5 executor × Fable 5 advisor

其基础是 Anthropic 于 2026 年 4 月 9 日发布的 advisor tool。廉价的 executor(执行者)模型将任务驱动到最后,仅在难以判断的局面才向更高一级的 advisor(顾问)模型咨询——这一配置通过一个 API 工具定义即可实现。@ClaudeDevs 将 Claude Sonnet 5 点名为此 executor。

这条帖子介绍的配置是:执行者 Sonnet 5 在难以判断的场面调用 Fable 5 以获取建议,大部分 token 按更廉价的 executor 一侧的单价计费。据 API 文档,advisor 读取 executor 工作的上下文,仅返回简短的建议(通常 400~700 个文本 token),并不生成面向用户的最终产出物。正如前述价格表所示,Sonnet 5 的单价在导入价格下恰为 Fable 5 的 1/5,而昂贵的单价仅适用于简短的建议部分。

其效果体现在随后一条帖子公布的实测数据中。

在编码基准 SWE-bench Pro 上,该配置以约 63% 的价格达到 Fable 5 单体分数的约 92%。而且每个任务调用 Fable 5 的次数很少(大约 1 次),大部分工作由 Sonnet 5 执行。“仅在关键处才向更高一级模型咨询”的设计,在调用频率的实测数据上也得到了印证。

策略 B —— Fable 5 orchestrator × Sonnet 5 workers

第二种策略把角色反了过来。将 Fable 5 作为 orchestrator(指挥)来承担规划与指挥,而将实际工作委派给多个 Sonnet 5 worker(子智能体)。这里大部分 token 同样按廉价的 worker 一侧的单价计费。

这一策略也公布了实测数据。在 Claude Managed Agents 上测量 Web 调查基准 BrowseComp 时,该配置以 46% 的价格达到 Fable 5 单体 96% 的性能。这是因为大量消耗 token 的调查工作被委派给了 Sonnet 5 一侧。

但运行策略 B 的手段目前有限

数字比策略 A 更具吸引力,但实际运行它的途径目前仅有以下三种。

  1. Claude Managed Agents —— 与官方实测相同的途径。据官方文档,其以测试版提供,且对所有 API 账户默认启用(仅需指定 beta 请求头,无需申请)。不过它仅限 API 计费,在 token 费用之外还会加收会话执行时间 $0.08/小时。此外,与策略 A 的 advisor tool 不同,它不在 ZDR(Zero Data Retention)的覆盖范围内。
  2. 用 Claude Code 的子智能体近似 —— 将主模型设为 Fable 5,并在子智能体的定义中指定模型(model: sonnet),就能在订阅范围内组建类似的配置。不过并没有像 advisor tool 那样“一条命令即可启用”的机制,orchestrator 是否不亲自动手而进行委派,取决于提示词与智能体设计。这一途径也未公布官方实测数据。
  3. 用 Agent SDK 等自行搭建 —— 面向开发者、从智能体循环自行构建的途径。

以上均以 API 计费为前提,或需要相应的设计与搭建。对于以订阅方式使用 Claude Code 的一般用户而言,策略 B 目前难以纳入“轻松一试”的选项。

另外,这一实测数据是在 Claude Managed Agents 上的结果,Claude Code 并非原样配备了同名的“orchestrator 模式”。不过,Claude Code 有一个称为 subagents 的机制,可以按角色定义子智能体并委派工作。因此,作为思路它同样可以应用于 Claude Code,但官方实测数据本身需要作为 Managed Agents 上的结果来解读。

该选哪一个 —— 暂时选策略 A

从道理上说,两种配置共享“不让昂贵的模型产出 token”的原则,但主导权的放置方式相反。策略 A 中,廉价的模型动手,高一级模型专注于掌舵。策略 B 中,高一级模型掌握规划,廉价的模型动手。官方的实测数据也是在对照的场景下测得的:在逐次累积判断的编码工作(SWE-bench Pro)中策略 A 表现出色,在可向众多 worker 并行委派的调查工作(BrowseComp)中策略 B 表现出色。从数字可以读出的经验法则是:任务是单线程的选 A,工作可以分担的选 B。

然而在实际选择中,采用手段的差异是决定性的。策略 A 可用一条 Claude Code 命令启用,公布的实测数据也正是测量了该 advisor tool 本身。而策略 B,如前所述只能使用测试版的 API 功能或自行搭建,即便用 Claude Code 的子智能体近似,也没有佐证其效果的官方数字。只要以便捷与确切为标准来选择,暂时策略 A 就是现实之选。

另外,两个数值都是帖子中给出的概数,各自都是基于单一基准的测量。官方文档自身也留有保留:“Results are task-dependent. Evaluate on your own workload.”(结果取决于任务,请在你自己的工作负载上评估。)

advisor tool 的使用方法

启用方法在 Claude Code 的文档中明确记载如下。

The advisor tool is experimental and requires Claude Code v2.1.98 or later with the Anthropic API.

You can set the advisor model in three ways:

  • /advisor command: set or change the advisor mid-session and save it as your default
  • advisorModel setting: configure a persistent default in your settings file
  • --advisor flag: set the advisor for a single session at launch

(advisor tool 是实验性功能,需要 Claude Code v2.1.98 及以上版本并配合 Anthropic API 使用。设置 advisor 模型的方法有三种。/advisor 命令——在会话中途设置或更改 advisor,并将其保存为默认值。advisorModel 设置——在设置文件中配置持久的默认值。--advisor 标志——在启动时为单次会话设置 advisor。)

调用的时机由模型一侧判断,但也可以通过提示词明确指示进行咨询。另外,要将 Fable 5 用作 advisor,需要 v2.1.170 及以上版本以及组织的 Fable 5 访问权限。

模型的组合存在限制。advisor 的能力必须不低于主模型,Fable 5 可以成为 Haiku、Sonnet、Opus 中任一 executor 的 advisor。另一方面,当以 Fable 5 为主模型时,允许的 advisor 仅有 Fable 5。策略 A 的组合也符合这一限制。反之,若仍以 Fable 5 为主模型,即便加上 advisor 也不会减少 token 消耗(主模型会持续生成产出物,而且会因 advisor 部分而增加消耗)。

优点与缺点

优点。 第一,效果有官方实测数据的定量佐证(在 SWE-bench Pro 上以约 63% 的价格达到 Fable 5 单体约 92% 的分数)。第二,采用容易。在 Claude Code 中可用一条命令启用。第三,配备了管理成本的机制,例如对调用次数与建议长度设置上限。第四,在 Claude Code 中,即便在会话中途切换 /advisor,主模型的提示词缓存也不会失效。它也在 ZDR(Zero Data Retention)的覆盖范围内。

缺点。 第一,它是测试版 / 实验性功能,其行为、价格、提供条件都可能变更。提供仅限于 Anthropic API(以及 Claude Platform on AWS),在 Amazon Bedrock、Google Cloud、Microsoft Foundry 上无法使用。第二,advisor 每次调用都会重新读取整个对话。在 Claude Code 中这一读取不会被缓存,因此在漫长的会话中若被频繁调用,输入 token 费用(订阅方式下为上限消耗)会膨胀。API 也配备了 advisor 用的缓存设置,但要产生效果需从每次对话约 3 次调用起。第三,调用时机交由模型,Claude Code 一侧并没有强制或设定调用次数上限的机制(只能通过提示词指示)。第四,它不适合像单次 Q&A 那样没有规划余地的任务。最后,由于 Fable 5 advisor 的响应以加密形式返回,因此在使用 API 时人无法直接检视建议的内容,这也是运营上的一项限制。

小结

  • Claude Fable 5 的单价是 Opus 4.8 的两倍(输入 $10、输出 $50/MTok),加之新分词器使对相同文本所计入的 token 数也增加约 30%。作为主模型常用是难以持续的价格结构。
  • 官方 @ClaudeDevs 给出的解决方案,是“不让昂贵的模型产出 token”的两种配置。
  • 策略 A(Sonnet 5 executor × Fable 5 advisor)在 SWE-bench Pro 上以约 63% 的价格达到 Fable 5 单体约 92% 的分数。用一条 Claude Code 命令即可立即使用。
  • 策略 B(Fable 5 orchestrator × Sonnet 5 workers)在 BrowseComp 上以 46% 的价格达到 Fable 5 单体 96% 的性能。不过运行它的手段仅限于测试版的 API 功能(Claude Managed Agents)或自行搭建,目前难以纳入便捷的选项。
  • 理论上的经验法则是“单线程的编码选 A,可以分担的调查选 B”。若将采用的便捷程度与实测的确切程度一并考虑,当下的现实之选是策略 A。
  • advisor tool 是测试版功能、advisor 每次都会重新读取整个对话、Fable 5 advisor 的建议以加密形式返回等,也都是采用前应当把握的限制。

参考资料