OpenAI 在其面向开发者的文档中公开了一份面向 GPT-5.6 Sol 的提示指南(参见本文末尾的参考资料;由于原始 URL 在 2026 年 7 月 17 日时点被确认因访问环境不同而显示情况各异,本文主要以 2026 年 7 月 16 日时点的存档版作为出典)。本文以其内容为依据,梳理在提示写法上正在发生的思路变化。我们将指南直接陈述的内容,与由此读取到的考察加以区分。

结论——写的是「成果、约束、依据、完成标准」,而非步骤

指南的前提,可凝缩为如下一句话。

GPT-5.6 works best when prompts define the outcome, important constraints, available evidence, and completion bar, then leave room for the model to choose an efficient path.

(当提示定义了成果、重要的约束、可用的依据与完成标准,随后把高效路径的选择交由模型时,GPT-5.6 的表现最佳。)

这并不意味着完全不写步骤。对准确性所必需的前提获取步骤、工具的使用条件、验证方法、重试与停止条件、并行处理与逐次处理的取舍等,凡是对准确性或安全性不可或缺的步骤,指南仍要求明示。改变的是重心的放置方式:人类不应连模型自己能够判断的作业路径也一一细致地加以固定。

指南后半的「Suggested prompt structure(建议的提示结构)」提出了一个由 Role、Personality、Goal、Success criteria、Constraints、Tools、Output、Stop rules 八个项目构成的模板。其中 Goal、Success criteria、Constraints、Stop rules 四项,可读作对开篇所举的成果、完成标准、约束这些要素几乎原样的具体化。剩下的「依据(evidence)」并未作为独立项目单列,可读作以分散的形式具体化于 Constraints、Tools、Success criteria 的记述之中(此种对应并非指南明示,而是本文所做的梳理)。

为何是「成果」而非「步骤」——内部评测所显示的效果

「Simplify prompts first」一节,将应删与应留列举如下。

应删的:

  • 同一规则的重复记述
  • 不改变行为的冗余示例
  • 对已能稳定执行的行为所作的步骤指示
  • 与任务无关的工具及其说明

应留的:

  • 用户可见的成果
  • 成功标准与停止条件
  • 关于安全性、业务、依据、权限的约束
  • 依情境而定的工具选择规则
  • 所要求的输出格式与验证方法

在此基础上,指南将实施该梳理后的结果以如下数值示出。

In a sample of internal coding-agent eval runs, configurations with leaner system prompts improved evaluation scores by roughly 10–15% while reducing total tokens by 41–66% and cost by 33–67%. Results will vary by workload, so treat these ranges as directional and validate changes on representative tasks from your own application.

(在内部编码智能体评测的一部分样本中,采用更精简系统提示的配置,在把评测分数提升约 10~15% 的同时,将总令牌数减少 41~66%、成本减少 33~67%。由于结果因工作负载而异,这些数值应作为指示方向的参考值来对待,并应在能代表自身应用的任务上验证变更。)

正如指南本身所明记,这一数值来自面向编码智能体的内部评测的一部分样本,并非在聊天、写作、调查任务等其他用途上也已被证实取得同等程度改善的结果。在此前提下,至少在此评测中,所显示的结果是:增加指示并不直接关联于精度,反而删减之后评测分数得以上升。关于理由,指南陈述如下。

GPT-5-class models follow prompt contracts closely, so conflicting rules can create more instability than missing detail.

(由于 GPT-5 系模型忠实地遵循提示的契约,相互矛盾的规则所带来的不稳定,可能超过细节的缺失。)

模型越是忠实于提示的记述,写作者无意间植入的矛盾就越容易原样显现为不稳定的行为。写入越多步骤就越安全的直觉,在这一关系之下未必成立。

「写成果」具体指的是什么

「Outcome-first prompts and stopping conditions」一节,将这一思路说明如下。

Describe the destination rather than prescribing every step. GPT-5.6 can usually choose an efficient search, tool, or reasoning path when the prompt states what good looks like.

(描述目的地,而非规定每一个步骤。当提示陈述了「怎样才算好」时,GPT-5.6 多数情况下能够自行选择高效的检索、工具或推理路径。)

将完成标准具体化的,是停止条件(stopping conditions),它定义何时作答、何时重试、何时插入确认。指南所举的示例如下。

After each result, ask whether the core request can now be answered with useful evidence. If yes, answer.

(在每一次结果之后,追问是否已能以有用的依据回答核心诉求。若能,则作答。)

指南同时建议,避免大量使用 ALWAYS、NEVER 这类绝对规则,而在需要判断是否使用工具、是否继续迭代等场合,写下判断基准而非绝对规则。

以本文自身为素材,试比较两种写法(这并非 OpenAI 的示例,而是本文为比较而作)。

步骤型:

请先检索官方网站。接着打开 3 个相关页面,
分别加以摘要。此后,抽取其共通点……

成果型:

请仅使用 OpenAI 官方信息,说明 GPT-5.6 提示设计的变更之处。
对重要的主张附上依据,并将无法在官方信息中确认的内容作为
推测加以区分。当读者达到能够修改自己既有提示的状态时,即为完成。

后者并未固定检索次数或浏览页面的顺序。所确定的是成果(变更之处的说明)、依据(对重要主张的佐证)与完成标准(读者达到能修改自己提示的状态)。不过,「仅以官方信息为依据」这一约束,与前者同样得以保留。

自主性的边界与工具的收窄

「写成果、把路径交由模型」这一设计,与在多大程度上允许模型凭自己判断行动的界线划定是成套的。「Define autonomy and approval boundaries」一节,将无需批准即可推进的行动与需要批准的行动,分列如下。

  • 无需批准(安全范围内的行动):读取文件、查看日志、范围内的代码编辑、执行非破坏性测试、在受托范围内的本地变更
  • 需要批准的行动:向外部写入、破坏性操作、购买、实质性扩大对象范围

Define what level of action each request authorizes so the model can continue safe, in-scope work without unnecessary pauses while stopping before external, destructive, costly, or scope-expanding actions.

(定义每一次请求授权了何种级别的行动,使模型能够不作不必要的中断而继续安全、范围内的作业,同时在涉及外部、破坏性、高成本或扩大范围的行动之前停下。)

在「Tool routing」一节,所举的要点是:只交付与任务相关的工具,以及当准确性依赖于获取步骤时,须明记其前提步骤不可省略。此外,「Programmatic Tool Calling」(PTC)被界定为仅应用于过滤、去重、聚合、批处理这类成片范围的处理;而在一次调用即可完成的场合、需依结果而改变下一步判断的场合、以及最终回答需要引用的场合,直接调用被认为更为适宜。

长时间任务中的行为方式

「Long-running workflows and state」一节,处理的是横跨多个步骤的任务中的报告方式。在首次工具调用之前给出简短的前置说明,此后仅在局面发生重大变化时才更新——依此方针,陈述如下。

Do not ask the model to narrate routine tool calls.

(不要让模型对日常性的工具调用逐一实况解说。)

一次更新以各陈述一项「何事已确定」与「接下来做什么」为限;在压缩对话历史时,也建议按节点逐一汇总。

本指南的正文(2026 年 7 月 16 日时点的存档)中,并未进行以 Codex 或 ChatGPT Agent 为对象的说明。不过,此节所规定的「日常性调用不逐一实况解说」「仅在局面变化时报告」这一行为方式,可视为对于那种无需人在每一步介入、长时间持续运转的自主执行而言普遍所需的设计。另需说明,OpenAI 的文档此后已经更新,相关的现行Model guidance中新设了「Migrate with Codex」一节,其中明确处理了 Codex。

如何看待向「写成果」的转变

至此所见的设计,与将要求逐条写成细致步骤、按步引导模型的实践形成对照。不过本指南自身并未指名与此类实践相比较,须说明此种对比乃本文所做的梳理。

本指南所举的比较对象是 GPT-5.5(关于 reasoning effort 的迁移,GPT-5.4 也作为基准一并列出)。例如「Personality, collaboration, and response length」一节,陈述如下。

GPT-5.6 tends to be more concise by default than GPT-5.5.

(GPT-5.6 相比 GPT-5.5,在默认情况下倾向于更为简洁。)

在此基础上,指南建议一种分工:详尽程度的默认值以 text.verbosity 参数(low、medium、high)设定,而任务特有的要求写在提示一侧。此外,「Prompt migration workflow」一节列举了切换模型时的步骤:先在保持既有 reasoning effort 设定的状态下取得基准评测,再逐步移除充当支架的指示,只针对所测得的劣化施以有的放矢的修正。这是为避免让提示改写与模型行为变化同时移动的顺序安排。

综合这些来看,本指南所示的并非单纯的文章技法之变,而是一种分工:定义任务的外框——成果、约束、依据、完成标准,而将抵达该处的路径选择与细部判断交由模型。人类所承担的作业的重心,似乎正从「向 AI 撰写指示」,向「设计交托给 AI 的工作框架」转移。

小结

  • GPT-5.6 的提示指南建议一种设计:定义成果、约束、依据、完成标准,而不固定模型能够判断的作业路径
  • 在 OpenAI 内部的编码智能体评测中,所显示的结果是:精简后的配置将评测分数提升约 10~15%,并将令牌数减少 41~66%、成本减少 33~67%(指南本身注明,结果因工作负载而异,应作为指示方向的参考值来对待)
  • 自主性的边界(无需批准的行动与需要批准的行动之间的界线划定)、工具的收窄、长时间任务中的报告频率,也作为这一设计思想的延伸而被加以梳理
  • 指南所举的比较对象是 GPT-5.5(reasoning effort 的迁移中 GPT-5.4 亦一并列出)。以 Codex 或 ChatGPT Agent 为对象的说明,在 2026 年 7 月 16 日时点的指南正文中未见。相关的现行 Model guidance 中有处理 Codex 的一节
  • 人类所承担作业的重心正从「撰写指示」向「设计任务」转移这一判断,乃本文所作的考察

补记(2026 年 7 月 18 日):本文作为主要出典的 2026 年 7 月 16 日时点存档版的记述之中,相当于开篇定义句、关于提示契约的理由说明、停止条件一节、长时间任务一节的内容,在 2026 年 7 月 18 日时点所确认的现行页面上未能找到。现行页面并非单独的指南,而已被整合进覆盖范围更广的「Model guidance」页面。详细的比对已在续篇文章中加以梳理。

参考资料