提示词调试:结果不对时怎么改

「AI 又胡说八道了」是最常见的抱怨,但真正的原因往往分得清楚:可能是你没说清,可能是它没材料,也可能是这件事它本来就不擅长。把这五种原因分开,改起来就有章法。本章给一套先诊断、再修改、后验证的调试流程,以及一组几乎万能的反问句。

结果不对的五类原因

原因典型症状先改什么
目标不清答得挺全,就是不对路;像百科条目补受众、目的、动作,一次只留一个目标
缺上下文内容空洞、术语不对、编出你公司不存在的东西贴上材料、口径、示例、约束
约束冲突每次满足不同的要求,顾此失彼通读要求,删掉互相矛盾的那几条
超出能力数字算错、实时信息过时、引用是编的换工具:计算器、脚本、搜索、查文档
抽样随机性同样提示词两次结果差别很大调低温度、要求给依据、复跑比对

诊断顺序很重要:先怀疑自己的提示词,再怀疑模型能力,最后才怀疑随机性。多数人恰恰是反着来的,直接换模型,结果问题依旧。

诊断四问:让 AI 自己暴露问题

调试的第一步不是改提示词,而是搞清楚「它以为你要什么」。四句话轮流用,几乎能覆盖所有场景:

1. 复述任务:请不要回答我的问题,先用你自己的话复述一遍:你认为我要你做什么、
   依据是哪些要求、输出成什么格式。列出你不确定的地方。
2. 给依据:请逐条说明你的结论分别来自我提供的哪一句或哪一段;
   没有材料支撑的部分,请单独列出并标注「属于推测」。
3. 给两版:请给我两个差异明显的方案版本,并说明各自的取舍与适用场景,
   最后推荐一个并说明理由。
4. 自我批判:请以审稿人的立场指出上面回答中最容易出错或最容易被反驳的三处,
   说明为什么,并给出更稳妥的写法。

第 1 句用来看「理解偏差」,第 2 句用来抓幻觉,第 3 句用来解开「只有一个答案」的死局,第 4 句用来在交付前先排一遍雷。

逐步收窄:一次只改一个变量

同时改三处要求,你无法判断是哪一处起了作用。稳定的调法是阶梯式收紧:

第一轮(要方向):先给 5 个不同思路的一句话标题,只要标题,不要展开。
第二轮(选方向):我选第 3 个。请给它写 200 字大纲,分三节,每节一句话。
第三轮(补料):第 2 节太薄。请只用我下面提供的材料重写第 2 节,
                每句话都要能在材料里找到出处,篇幅 120 字。
第四轮(定型):按同一风格把三节都写实,统一为对外正式口吻,
                数字原样保留,全文不超过 600 字。

这个做法的好处:每一轮都能验证。第二轮不对就退回第一轮换方向,成本极低;如果一开始就让它写 2000 字,改起来每次都是重写。

追问三连:一句话问出质量差距

拿到一个「看着还行」的答案后,加上这三句,输出质量通常能再上一档:

追问句作用你会得到什么
为什么这样?逼它把隐含假设说出口暴露它默认的前提,可能正是错的
还有别的方案吗?打破第一条路径依赖第二、第三条通常比第一条考虑得更全
哪里可能出错?把风险讨论提前一份自带风险清单的结果

三连的写法可以直接复制:

针对你上面的方案,请依次回答三个问题,不要合并:
1. 你这样安排的主要理由是什么?其中哪些是假设、哪些有材料支撑?
2. 还有哪些可行方案?至少给两个差异明显的,说明代价。
3. 这个方案最可能在什么地方出错?请按「出错概率 × 影响程度」排序前三项,
   每项给一个可执行的缓解动作。

用 AI 检查 AI 的输出

自己写的、AI 写的,都不该直接交付。用「换角色审阅」的方式做一道自查:

你现在的身份是严格的审稿人,不是作者。请审查下面这份文本,只找问题,不要夸奖。
检查项:
1. 事实与数字:与 <材料> 是否一致?逐条比对,列出不一致处。
2. 逻辑:有没有前后矛盾、结论跳步、以偏概全?
3. 遗漏:按标题承诺的内容,哪一节没有兑现?
4. 表述:有没有空话、套话、无法验证的形容词?
输出格式:Markdown 表格,列为 位置 / 问题类型 / 具体问题 / 修改建议,按严重程度排序。

<材料>
(粘贴原始资料)
</材料>

<待审文本>
(粘贴 AI 生成的内容)
</待审文本>

注意三点:一是换一个对话窗口或新角色,同一段上下文里它倾向于自我肯定;二是必须提供原始材料,否则它只能凭印象挑毛病;三是表格化输出,便于你逐条销项。

一轮调试的标准动作

  • 保留原始提示词:出问题时能对比,好结果也能复现。
  • 只改一处再试:改完立刻重跑,观察变化方向。
  • 记录有效版本:把跑通的提示词存进模板库或技能包(见后续章节)。
  • 分清「不满意」和「不可用」:不满意可以迭代,不可用(事实错、算错)要立刻换方案。

常见坑

后果改法
一不满意就换模型提示词问题被掩盖,换个模型照样不行先做「复述任务」诊断
一次加五条新要求不知道哪条有效,问题还可能被掩盖一次只改一个变量
让它「再想想」结果随机变化,没有方向给具体的检查项与标准
用它自己检查自己倾向于说「没问题」换角色、换窗口、给原始材料
把随机性当能力问题反复重试浪费时间固定提示词复跑两次,先看结果是否稳定

小结:结果不对先分五类归因——目标、上下文、约束冲突、能力边界、随机性;用「复述任务、给依据、给两版、自我批判」四问定位问题,用逐步收窄一次改一处,再用换角色的审阅提示词完成交付前自查。

笔记加载中…