‹ 返回实战解答目录

实战解答

AI 输出不对,怎样用证据定位问题?

用一份失败记录、一次单变量修改和同一条复验命令,把“感觉不对”收敛成可以处理的原因。

先给结论

直接回答

先暂停重跑,保存错误输出和原始输入;再写出一个能重复失败的检查,只改一个最可能的原因,并用同一检查复验。判断依据是前后证据,不是模型自己的解释。

下载空白排查清单 下载内容是待填写的空白模板,不包含已填案例或私有资料。

适用边界与版本日期

这套方法适用于“AI 已经产出结果,但结果与任务要求不一致”的情况,例如漏字段、改错文件、格式不合格或测试失败。本文按 2026-08-30 的公开工作流整理,不依赖某个模型或界面版本。

它不适合处理账号被封、服务中断、付款争议或疑似凭据泄露。遇到这些情况,不要继续尝试,应转到对应平台的安全或支持流程。

先准备一个不含敏感信息的练习场景:假设你让 AI 把三条虚构会议记录整理成表格,但结果漏掉了“负责人”列。接下来不要立刻重跑。

跟着做

  1. 把失败现场冻结下来。 在清单中写下任务目标、原始输入、预期结果和实际结果。保留当次输出、退出码或页面状态;不要先修改原文件,也不要用新输出覆盖旧输出。
  2. 把“感觉不对”改成一句可检查的话。 例如:“三行结果都必须有负责人字段,目前第二行没有。”这句话必须能由人或已有检查工具重复判断。
  3. 沿四个位置找证据。 依次检查任务要求是否写清、输入是否完整、执行过程是否越界、最终产物是否满足验收。只记录看得到的事实,不先写“模型理解错了”之类的原因。
  4. 选择一个最小原因。 如果输入里本来就没有第二行负责人,先补输入;如果输入完整但提示词没要求字段,先补验收条件。一次只动一个位置。
  5. 用原来的检查复验。 重新执行后,仍然检查“三行是否都有负责人”,不要临时换成更宽松的标准。把新结果与旧结果并排保存。

现在停 30 秒,先回答两个问题:你能指出哪一条可见证据证明失败吗?你准备修改的变量是否只有一个?任一答案为“不能”,都先不要重跑。

应该看到什么

完成后,你手上应有四件东西:一份未经改写的失败输出、一句可重复的失败条件、一处明确的单变量修改、一次用相同标准得到的复验结果。

复验不一定立即变成通过。如果原来的一个大问题缩小成更具体的小问题,也算定位前进了;例如“漏字段”收敛为“只有空值行漏字段”。此时继续下一轮单变量实验,而不是一次改五处。

证据与验收

按下面四项验收本轮排错:

  • 现场证据: 失败输出仍可查看,记录有时间或版本标识。
  • 可重复性: 同一个检查在修改前确实失败,不能只引用 AI 的自述。
  • 改动边界: 差异里只有本轮声明的变量发生变化。
  • 复验证据: 同一个检查在修改后通过,或失败范围有明确缩小。

如果你只能说“这次看起来好多了”,还不能结束。把“好多了”转换成字段数、失败条目数、测试结果或人工核对表中的具体变化。

常见失败、补救与停止线

  • 连续重跑,结果每次都不同: 回到第一步,固定输入、指令、模型设置和检查标准,再做比较。
  • 同时改输入、提示词和代码: 撤回到冻结副本,选证据最强的一处先改。
  • 把 AI 的解释当根因: 将解释视为待验证假设,必须找到输入、日志、差异或结果中的对应证据。
  • 为了通过而放宽检查: 恢复原验收条件;若业务规则确实要变,另开决策记录,不要混在排错里。

出现原始场景被覆盖、敏感内容进入日志、改动跨出授权目录,或无法重现最初失败时,立即停止。本轮状态应写成“证据不足”或“边界被破坏”,不能写成已修复。

来源与深入阅读

这是一条从完整教学案例中提炼出的快速入口。需要学习如何保存 RED 证据、执行单变量修复并留下 GREEN 回执,请继续阅读 《Codex 使用手册》第 13 章:用证据排错

公开依据

从快速解答回到完整现场

这页负责快速解决一个问题;下面的公开 Note 保留完整背景、过程和边界。

本页目录
  1. 适用边界与版本日期
  2. 跟着做
  3. 应该看到什么
  4. 证据与验收
  5. 常见失败、补救与停止线
  6. 来源与深入阅读