‹ 返回笔记 · Back to notes

现场手记

《Codex 使用手册》· 第 2 章(下)|安全的只读练习

学习纠错、停止、人工介入、验证,并完成一次可核对的只读资料盘点。

CHAPTER 02 · 2.10–2.18

教材版本:v1.0 · 官方资料核验:2026-08-13 · 当前界面与账号可用性以读者实际状态为准。

2.10 为什么 Codex 会做错

官方来源: Permissions

本节要回答

Codex 说错一句话时,问题一定在“模型能力不够”吗?怎样从材料、目标、范围、事实类型、工具环境和验收六个方向定位错误,并给出最小修正,而不是一上来整段推倒重来?

先用白话解释

“做错”通常是闭环中的某个环节没有写清或没有核对,不一定是模型突然失常。本案例里,以下六类错误尤其容易混在一起。第六类单独列出,是为了避免把产品面、账号、计划、本地项目目录、权限或地区造成的不可见、不可用,误判成模型能力失败。

第一类是材料不足。症状是输出直接决定了时间、场地或人数,或者引用了本次没有提供的文件。根因可能是材料本来没有答案,也可能是读者把“同一个练习包”误当成“已经授权全部读取”。预警信号是出现没有来源的新数字、引用补充问题.md,或 Codex 说“我再扫描一下目录”。最小修正是停下,重新列白名单,只读通知与要求.md和零散记录.md,把缺失项写成待确认。复查证据是每条事实都能指向文件和小节,实际使用文件只有两份。

第二类是目标含糊。症状是你要“整理资料”,结果却变成活动方案、宣传文案或任务分工决定。根因是“整理得专业一点”“顺便给出建议”没有说明交付边界。预警信号是结果中出现材料没有要求的产品或决策。最小修正是把目标缩成“只读盘点”,只要求已知、缺失、待确认和实际使用文件四部分对话输出。复查证据是输出没有替活动确认时间、人数、场地,也没有产生额外文件。

第三类是范围不清。症状是本来只允许对话输出,却出现写文件、联网、打开真实网站,或者本来只允许两份文件,却扩大为整个文件夹。根因是动作没有逐项写出,或者人把“可以继续”误当成“一揽子授权”。预警信号是出现“我顺便保存”“我可以查一下网页”“我会读取相关资料”等模糊句。最小修正是补四句:允许输入、唯一输出、禁止项、停止点;每次范围变化先停。复查证据是人核对本次可见输入、工具活动和真实系统提示;若未见文件、联网或目录外动作就如实记录,缺少可观察证据标待确认。

第四类是事实类型混淆。症状是把“建议约 60 分钟”写成已经确认,把“可能约 20 人”写成参加人数,把“有人建议带真实文件”写成活动要求。根因是材料中的已知、建议、猜测、待确认排列在一起,模型或读者只看句子内容,没有看标签。预警信号是输出里出现“将”“确定”“安排为”,但原文对应段落属于建议或猜测。最小修正是强制分栏,保留“已知/建议/猜测/待确认”原标签;冲突要单列,不能用一个“综合结论”抹平。复查证据是每条建议和猜测旁边都有来源类别,未确认数字没有被写入事实摘要。

第五类是验收缺失。症状是回答读起来很顺,就被当成“完成”,但没有回原文,也没有核对本次使用的文件,更没有记录人是通过、退回还是待确认。根因是把生成和判断混成一个动作。预警信号是出现“模型说已经完成”“格式很漂亮”“没有报错”,却没有核对点。最小修正是暂停下一步,按事实、来源、范围、输出四栏回查,再由人作结论。复查证据是人工验收能指出至少两条原文锚点,并明确结论和理由。

第六类是工具或环境受限。症状是你看不到某个入口、模型选项、Browser、插件、Computer Use 或文件动作,或者系统提示说当前工作区、账号、计划、权限、地区或产品面不满足条件。根因不一定是模型不会做,可能是当前产品面没有该能力、账号资格不同、本地项目目录未准备好、权限尚未允许,或目标地区和版本条件不同。预警信号是“别人截图里有、我这里没有”就被直接解释为模型失败,或者有人建议自行升权、改设置、换账号绕过限制。最小修正是记下实际显示的提示和当前产品面,回到官方当前说明核对适用条件;如果没有可靠条件,就退回最小动作,继续做不依赖该能力的部分,不擅自升权。菜单可见性、实际可用性和运行结果都应按界面记录的核验日期、产品面和条件记录,不能从一次观察外推。复查证据是保留真实提示、日期、产品面和条件,并明确“未能验证”而不是猜测原因。

这六类错误可以同时出现。例如,“请整理所有材料并给出最终安排”既有材料扩大、目标含糊和范围不清,随后又容易把建议写成事实;如果当前工作面又没有文件写入能力,最后还可能把环境限制误判为模型失败。发现复合错误时,先处理最靠前的边界和材料,再处理目标、事实分类和工具环境,最后才润色表达。

你会看到/跟做

拿一条模拟输出逐项贴标签,不要先改文字。看到一个新数字,先问“它来自哪一份材料、哪一类信息”;看到一个新动作,先问“这是任务允许的动作吗”;看到一个结论,先问“谁来验收、证据在哪里”;看到一个不可用入口,先问“是模型问题,还是产品面、账号、计划、本地项目目录、权限或地区条件”。将问题写成六列:错误类别、原文症状、根因假设、最小修正、复查证据、工具或环境条件。

以“建议一页摘要便于手机阅读”为例,如果输出写成“摘要必须控制在某个固定字数”,应归为事实类型混淆;若输出直接创建了摘要文件,应同时归为范围不清。先要求它改回“建议”,再要求停止文件动作。不要把两个问题混成一句“请重新做好”。

预期结果

你能够指出错误发生在闭环哪一段,并给出一个小而明确的修正。你不会因为结果不理想就立刻换模型、提高推理档位或把所有材料都交出去;先查材料、目标、范围和验收,通常更快也更安全。

最小练习与验收

请写六个一行错误示例,分别对应六类错误,再为每行补一句“最小修正”和一句“复查证据”。验收时检查:每个修正都只解决一个主要问题;没有把未知补成事实;期望不新增联网、文件写入或目录扫描,但是否确实未发生要由人核对本次可见输入、工具活动和真实系统提示;缺少可观察证据标待确认;工具或环境受限的那一行没有擅自升权。

常见误区(预警 / 补救 / 证据)

  • 常见坑:只归咎模型。预警:一看到错误就说“模型太差”,却没有检查任务是否写了材料、环境条件和验收。最小补救/停止点:先按六类错误逐项排查。复查证据:修正前后有可对照的任务范围、来源清单和真实环境提示。
  • 常见坑:用更多材料掩盖材料不足。预警:遇到缺口就想把第三份材料、网络和旧项目一起交给 Codex。最小补救/停止点:保留缺口,写成待确认。复查证据:本章仍只用两份材料,补充问题.md明确未读。
  • 常见坑:一次改很多处。预警:修正提示同时要求重写、联网、建文件和发布。最小补救/停止点:拆成一项任务、一个目标输出。复查证据:新结果能说明只改了哪一项。

下一节

发现错误以后,下一步不是强行让 Codex继续,而是判断是否碰到了必须停止的红线。

2.11 什么时候应该要求 Codex 停下

官方来源: Using Codex with your ChatGPT planUsing the built-in browser in the ChatGPT desktop appPermissions

本节要回答

什么叫“停止”?是不是所有有风险的请求都要拒绝?当范围开始变化、出现真实提示或涉及真实资料时,普通人怎样先保护现场,再决定是否继续?

先用白话解释

停止不是把任务永久取消,而是暂时不执行下一步,保留当前证据,等人重新判断。以下情况都要停:

  1. 出现额外文件:要求读取补充问题.md、同目录其他文件、桌面或 Downloads。
  2. 出现联网或 Browser host:要打开尚未确认的 host、跟随不可信页面、把网页内容补进结果。
  3. 出现插件或 OAuth:要求安装、连接账户、授权外部服务或发送数据。
  4. 出现 Computer Use 或真实应用:要求操作真实办公软件、浏览器窗口、邮件、云盘或登录后的页面。
  5. 出现外部发送、发布或分享:要把材料发给别人、上传网站、生成公开链接或提交表单。
  6. 出现付款或交易:涉及订单、充值、转账、购买、订阅或任何收费确认。
  7. 出现删除或覆盖原件:包括删除原始材料、覆盖同名文件、移动、重命名或清空回收站。
  8. 出现未知命令或未知提示:你看不懂命令、弹窗、权限请求、host范围或将要发生的后果。
  9. 出现真实敏感资料:账号、姓名、客户文件、联系方式、会话、Cookie、令牌、密钥或未脱敏截图。

这些停止线不是说相关能力永远不能用,而是说它们不属于当前只读盘点的默认范围。一个请求从“读两份虚构材料”变成“顺便查网页”,就是范围变化;范围变化先停,之后由人决定是否另开任务、另列材料和另做隐私检查。

记住四步卡:停—记—问—再决定。

  • 停:不点击、不运行、不发送,不让动作继续扩大。
  • 记:记下触发动作、涉及材料、界面提示和当前已完成部分。
  • 问:问清目的、输入、外部对象、唯一结果和人工验收人。
  • 再决定:由人确认是否新建任务、缩小范围或明确拒绝。

可复制的停止回复是:

“先停在这里。你刚才提出了【具体动作】,它超出本次只读范围。请不要继续读取、联网、连接账户、操作真实应用、发送、发布、付款、删除、覆盖或运行未知命令。请先列出触发原因、涉及的输入和可能改变的状态;我会重新确认范围、唯一目标和人工验收后再决定。”

如果只是材料中缺一个普通事实,并不需要立刻拒绝整个任务。可以让 Codex把它列为待确认,并继续完成不依赖该事实的只读部分;这就是“范围变化先停”,而不是“所有不确定都拒绝”。

你会看到/跟做

用本案例逐项模拟:Codex提出读取补充问题.md;提出打开一个未允许的网页;提出创建盘点文件;提出把摘要发给内容确认人。每次只练习回复四步卡,不执行动作。记录四列:发生了什么、为什么越界、保留了什么证据、下一步由谁决定。

如果出现真实系统提示,原样记录它显示的范围,不根据教程猜测按钮含义。如果当前工作面未提供系统提示,写“在本次可见输入、工具活动和真实系统提示中未见;缺证据标待确认”,不要画一个假弹窗替代观察。

预期结果

你能准确说出“停止在什么地方”,并保留现场,不会因为担心风险而把所有正常只读任务都拒绝,也不会因为结果看起来有用而跳过外部动作确认。

最小练习与验收

从九类停止线中任选六类,写出对应的停—记—问—再决定四句。验收要求:每句都有具体动作;至少包含一个 Browser host、一个插件/OAuth、一个删除或覆盖原件;没有把“确认后可以继续”写成“系统已经批准”。

常见误区(预警 / 补救 / 证据)

  • 常见坑:停止后仍让 Codex继续“先做一点”。预警:已经发现越界,却继续让它读取或发送。最小补救/停止点:停止工具动作,保存当前对话和提示。复查证据:停止时点和已完成范围清楚。
  • 常见坑:把未知提示当成默认允许。预警:看不懂弹窗仍点击确认。最小补救/停止点:记录原文,询问具体影响。复查证据:有人能解释输入、目标和后果。
  • 常见坑:把停止线写成永久禁令。预警:连本地只读也被一概拒绝。最小补救/停止点:区分当前任务边界和未来另行授权。复查证据:新任务有新的材料、目标和验收。

下一节

停下来之后,人需要给出有界纠偏,才能让任务安全回到正确轨道。

2.12 怎样进行一次正确的人工介入

官方来源: Permissions

本节要回答

人工介入怎样做到既有效又不把任务越改越大?为什么“再好一点”“重新做一遍”通常不是好提示?怎样让旧答案和新答案分开,避免错误被悄悄覆盖?

先用白话解释

正确人工介入有四类,先判断属于哪一类,再写一句具体指令。

第一类,指出具体错误句。适用于来源错、标签错、数字错。例如:“你把‘建议总时长约 60 分钟’写成已确认,请改回建议,并保留原文锚点;不要改动其他条目。”不要说“你理解错了”,因为它没有指出哪一句、应该改成什么。

第二类,补充唯一必要材料。适用于当前任务真的缺一份已授权输入。例如:“补充材料尚未纳入本次任务;先不要读取。我只是在下一轮重新确认是否把它列入白名单。”如果确认要加材料,要新列文件名、用途和停止点,不能用“把相关材料都给你”。

第三类,缩小目标或唯一输出。适用于任务同时产生多个结果。例如:“撤回活动方案和对外说明,只保留对话中的四栏资料盘点;不创建文件、不联网。”缩小目标比要求模型“更谨慎”更可检查。

第四类,拒绝越权。适用于读取额外文件、联网、外发、修改原件或操作真实应用。例如:“这一步超出本次范围,停止,不要执行;保留已经得到的只读结果,等待我重新确认。”拒绝越权不是拒绝整项工作,而是拒绝未经确认的那一个动作。

修改提示后必须重新验收。不能把旧答案里正确的一半和新答案里未经核对的一半直接拼在一起,也不能只看模型的“已修正”声明。最安全的做法是标记“旧结果”“新结果”“本次人工修改要求”,重新对照原文并给新结果单独结论。

你会看到/跟做

先用四张卡模拟纠偏:

  • 具体错误句:“将‘可能约 20 人’改回猜测,不得写入已知事实。”
  • 唯一材料:“本轮仍不读取补充问题.md,只保留两份白名单。”
  • 唯一输出:“只在对话中输出四栏,不创建资料盘点文件。”
  • 越权拒绝:“停止联网和外部发送;请列出触发动作,等待我决定。”

每张卡都加一行“保持不变”:例如“其他已知事实、来源锚点和本次使用文件不变”。这能防止修一个标签时顺手重写整份结果。

预期结果

你可以用一句话指出错误位置、所需变化和不应变化的部分。Codex修正后,你会重新检查,而不是把人工指令本身当成正确性证明。

最小练习与验收

把“请再做得好一点”改成四条有界提示,每条分别对应一种介入类型。验收:每条有唯一目标;没有“全部重写”“顺便查资料”;至少两条写明保持不变;每条都说明修正后要重新验收。

常见误区(预警 / 补救 / 证据)

  • 常见坑:人工提示太宽。预警:一句纠偏同时要求补材料、改格式、联网和发布。最小补救/停止点:拆成单一目标,先完成并验收一项。复查证据:新旧结果差异能定位。
  • 常见坑:把纠偏当作授权。预警:模型说“收到”就直接执行外部动作。最小补救/停止点:重新写任务级范围确认,系统提示只按实际出现审阅。复查证据:实际输入、动作和输出均有记录。
  • 常见坑:旧答案污染新答案。预警:复制粘贴时没有标明哪些句子来自旧结果。最小补救/停止点:在同一对话中用清楚的分段标记,或在项目外纸面/学习笔记记录;本次不让 Codex 创建文件。复查证据:人工验收只针对新结果作结论。

下一节

纠偏完成后,还要用证据判断结果是否真的可用,这就是验证。

2.13 什么叫验证

官方来源: PermissionsWork with files

本节要回答

“看起来不错”和“验证过”有什么区别?不同结果要用什么证据?本章没有文件结果,为什么仍然要练习打开原文、检查来源和确认实际使用文件?

先用白话解释

验证不是再读一遍模型的回答,而是拿回答去对照独立证据。对话文字要回原文;文件结果要真正打开;修改结果要看差异;外部动作要确认实际状态,而不是看“发送成功”字样。模型的自我说明、界面上的完成状态、计划、工具活动和文件存在,都只能提供线索,不能代替人工验收。

本章的只读资料盘点没有文件结果,所以基础验证只做四栏核对:

  1. 事实四栏是否完整:已知、缺失、待确认,以及建议/猜测是否独立标注。
  2. 来源锚点是否准确:每条事实能回到通知与要求.md或零散记录.md的标题、小节或条目。
  3. 实际使用文件是否准确:只有通知与要求.md、零散记录.md。
  4. 排除和动作是否准确:补充问题.md未在输出中被引用;人核对本次可见输入、工具活动和真实系统提示,未见文件动作、联网或目录外动作时如实记录,缺少可观察证据标待确认。

进阶验证可以加入版本和差异意识:记录读取时的文件名、版本或日期;如果同名材料发生变化,先标出变化再重新盘点;如果 Codex给出两版结果,逐条对比新增、删除和改写。新手不必使用终端,打开文件、搜索原文和手写对照表就足够;关键是证据独立于模型的自我评价。

你会看到/跟做

先在屏幕上打开两份原文,旁边放对话结果。用三种标记:事实旁标来源,建议/猜测旁标类别,待确认旁标缺口。遇到“约 60 分钟”“可能 20 人”“可能需要 1 名协助者”,分别回到零散记录.md的建议或猜测小节,确认没有被移进已知。

再检查输出结尾的“本次实际使用文件”。逐字比对文件名,确认没有“项目资料”“相关文件”这种无法复查的概括。最后在学习记录写一句“本次没有文件结果;在本次可见输入、工具活动和真实系统提示中未见网络或系统权限动作;若证据不足则标待确认”。“没有文件结果”是本次任务的输出预期;是否确实未发生文件动作,仍由人按可观察证据判断。

预期结果

你能解释每一项结论的证据来源,并能发现一个读起来顺但没有来源的句子。你不会因为没有使用终端、没有截图或没有复杂工具,就认为没有完成验证。

最小练习与验收

做一张基础验收表,至少列出“事实、来源、类别、实际使用文件、未读文件、文件动作、网络动作、人工结论”八列。每列填入本案例的观察或“无”。验收:未读补充问题.md清楚写出,建议和猜测没有被合并,结论由人填写。

常见误区(预警 / 补救 / 证据)

  • 常见坑:把同一段回答反复阅读当验证。预警:没有打开原文或来源锚点。最小补救/停止点:回原文逐条定位。复查证据:验收表有文件名和条目。
  • 常见坑:把文件存在当正确。预警:没有打开、没有看差异、没有确认版本。最小补救/停止点:暂停交付,人工打开并核对。复查证据:打开记录和差异说明。
  • 常见坑:为证明验证而强行使用终端或截图。预警:工具本身成为新风险。最小补救/停止点:回到新手基础版,使用打开、搜索和手工记录。复查证据:动作没有超出本章边界。

下一节

验证方法明确后,把它们收进一张五字段任务卡,任何普通工作都可以从这张卡开始。

2.14 五字段任务卡

官方来源: Permissions

本节要回答

怎样把一次任务写成别人也能照着执行的说明?五字段任务卡和“提示词技巧”有什么不同?为什么它也不是产品的系统权限弹窗?

先用白话解释

五字段任务卡是一份小型任务合同,不是花哨的提示词。它让人和 Codex 对同一件事有共同理解,也让任务结束后有可以回查的标准。五个字段是:

  1. 目标:这次要回答或形成什么,不顺便扩大。
  2. 材料:允许使用哪些文字或文件,哪些明确不读。
  3. 禁止项:不能做哪些动作,遇到什么必须停。
  4. 输出:交回对话文字还是文件,结构和唯一目标是什么。
  5. 人工验收:人检查哪些证据,最后判定通过、退回或待确认。

空白模板可以这样写:

目标:________________________________

材料:________________________________

禁止项:________________________________

输出:________________________________

人工验收:________________________________

本书教材方法 M 要求人先做任务级人工范围确认:确认输入、唯一目标、禁止项和停止点。它不是系统权限弹窗,也不保证产品在本地项目目录内逐文件询问。真实系统提示只有实际出现时才审阅。

本案例的完整填写版如下:

目标:只读盘点家庭资料整理入门的已确认信息、缺失信息和待确认问题,保留建议、猜测和冲突标签。

材料:通知与要求.md、零散记录.md;明确不读取补充问题.md。

禁止项:不创建、修改、追加、移动、重命名或删除任何文件;不联网;不访问目录外;不连接真实应用、插件或账号;不向外发送或发布;如出现额外材料、Browser host、权限提示、未知命令或看不懂的要求,立即停下。

输出:只在当前对话中输出四部分:已知信息、缺失或冲突、待确认问题、本次实际使用文件;每条事实标出来源,建议和猜测单独标记。

人工验收:人打开并对照通知与要求.md、零散记录.md;确认两份白名单内的事实可回原文,建议/猜测未变成事实,输出未引用补充问题.md;再核对本次可见输入、工具活动和真实系统提示,未见文件和网络动作时如实记录,缺少可观察证据标待确认;最后写通过、退回或待确认及理由。

逐字段看“没写会怎样”。没有目标,Codex可能把盘点扩成方案或宣传;没有材料,无法判断它是否读了额外文件;没有禁止项,“顺便查网页”可能被当成正常下一步;没有输出,模型可能创建文件或交回一份不需要的长报告;没有人工验收,“完成”只能是模型自述。五字段不是让模型变聪明,而是让人的意图和证据可见。

你会看到/跟做

先复制空白模板到纸面或项目外学习笔记,按本案例自己填写,不要直接照抄完整版。填写后和完整版逐项比较:目标是否仍是只读盘点,材料是否只有两份,禁止项有没有文件和网络边界,输出是否只有对话,验收是否写了原文核对。

再请另一个人只看你的五行,不看前文,复述本次任务。如果他问“补充问题.md能不能读”“结果写在哪里”“谁决定通过”,说明卡片还不够具体。只改对应字段,不要为了回应一个问题整张重写。

预期结果

你可以在半分钟内说明任务的输入、动作、唯一结果和停止线;另一个人也能据此判断 Codex 是否越界。任务卡保留人的决定,不把模型的计划或系统提示写成授权证明。

最小练习与验收

各写一张“只读盘点卡”和“创建一份本地草稿卡”,比较两者的禁止项和人工验收差异。第二张卡只作理解练习,本章不执行它。验收:两张卡的输出目标不混淆;创建草稿的卡明确新增状态变化和打开核对要求;只读盘点卡明确不创建文件。

常见误区(预警 / 补救 / 证据)

  • 常见坑:把任务卡写成一句长提示。预警:输入、输出和停止点混在一起,无法逐项核对。最小补救/停止点:拆回五字段。复查证据:每个字段都能单独回答一个问题。
  • 常见坑:把人工验收写成“让 Codex 自检”。预警:验收栏只有“模型确认无误”。最小补救/停止点:改为人回原文、打开结果、看差异或确认实际状态。复查证据:有人的结论和证据位置。
  • 常见坑:把系统弹窗当任务卡。预警:卡片写“等产品逐文件批准”。最小补救/停止点:改成任务级人工范围确认,真实提示另行记录。复查证据:没有假设的弹窗文字。

下一节

下一节把五字段卡真正用于一次只读资料盘点,从准备提示到人工判定完整走一遍。

2.15 最小案例:一次只读资料盘点

官方来源: Projects and chatsPermissions

本节要回答

怎样把前面学到的边界、材料、动作、结果和验收,组成一次可以复制练习的完整任务?怎样判断 Codex真的只读了两份材料,而不是“看起来像读过”?

先用白话解释

下面这段提示可以直接复制到 Codex 的新任务/新对话中。发送前由人逐个加入通知与要求.md、零散记录.md;如果当前工作面没有附件或本地项目入口,就把两份文件原样粘贴进消息,并在开头写明文件名。不得选择整个练习包或上级目录;如果看不到入口就记录“当前工作面未提供该入口”,不要猜菜单、不要把别的入口当成等价功能。角色只作为表达风格选项,不代表增加权限,也不代表产品会自动打开某个工作面。

“你现在是资料整理助手。本次只做一次只读资料盘点,不做方案决策。

目标:根据允许的两份虚构材料,整理家庭资料整理入门活动中已经确认的信息、材料没有提供的信息、需要继续确认的问题,并保留建议、猜测和冲突的类别。

允许使用的材料只有:通知与要求.md、零散记录.md。请先在对话中复述这两份白名单。明确不打开、不读取、不引用补充问题.md,也不扫描同目录或其他目录。若两份材料是粘贴内容,请按文件名分别标记,不要把整包或上级目录当成输入。

禁止项:不创建、修改、追加、移动、重命名或删除任何文件;不联网,不访问 Browser host,不连接插件或 OAuth,不登录真实服务,不操作真实应用,不向外发送、发布或分享,不运行未知命令;若出现额外文件、外部动作、系统权限提示、未知命令或看不懂的界面,请停下并说明触发原因。

只在对话中输出四部分:一、已知信息;二、缺失信息和材料中的冲突;三、待确认问题;四、本次实际使用文件。每条来自材料的事实都标出文件名和小节或条目锚点;建议、猜测必须保留原标签,不得改成已确认事实。

完成后不要说‘任务已完成’就结束,请先列出你实际使用的文件、没有读取的文件和是否发生文件、网络或外部动作,等待人工验收。若工作面没有提供计划、工具活动或系统提示,请写“当前工作面未提供这类可观察证据”;对于未见动作,写“在本次可见输入、工具活动、真实系统提示中未见;缺证据标待确认”。实际使用文件清单只是我的人工复核线索,不是你的自证。”

为什么这样写?第一段限定角色和目标,避免“助手”被理解成可以自行决定;第二段把两份白名单写全,并把第三份排除写明;第三段将高风险动作列成可观察停止线;第四段规定唯一输出是对话四部分;第五段要求来源锚点和实际使用文件,给人工验收留下证据。角色可以删掉,不影响安全边界;安全边界不能只靠角色名称。

你会看到/跟做

先复制提示但不要马上发送。用荧光笔检查五处:目标是否只有盘点,材料是否只有两份,禁止项是否覆盖文件/网络/外部动作,输出是否期望只有对话结果,验收是否要求回原文。确认后发送,并观察 Codex是否先复述范围、是否列出实际文件、是否把建议和猜测分开。输出“不新增文件、网络引用或外部动作”只是期望;是否确实未发生,由人核对本次可见输入、工具活动和真实系统提示,缺证据标待确认。

可接受输出不需要和参考包逐字相同,最低结构应类似:

  • 已知信息:活动目的、对象、三个基本环节、不收集或展示真实个人文件、空白分类卡/空白文件夹/虚构示例、两个角色及其职责、时间场地人数和对外说明尚未确认。每项注明来源。
  • 缺失或冲突:没有时间、场地、人数和最终对外说明;有人建议带真实文件,但与已确认隐私限制冲突;有人建议先做外部宣传,但发布尚未确认。
  • 待确认问题:时间场地、人数上限、约 60 分钟建议是否采纳、空白分类清单和物资由谁准备、是否制作及由谁确认对外说明、是否需要现场协助者等。每项注明来自哪份材料的待确认或建议。
  • 本次实际使用文件:通知与要求.md、零散记录.md;明确未读取补充问题.md。

这些只是结构和少量忠实示例,不是把参考包全文交给读者,也不是证明任何文件已被 Codex创建或实测。

预期结果

可接受输出应不凭空增加事实数字、不引用第三份材料内容、不声称发生文件路径变更或网络引用;这些是输出期望,不是系统动作证明。人仍须核对本次可见输入、工具活动和真实系统提示,缺少可观察证据标待确认。

最小练习与验收

人工验收表可以这样填写:

检查项通过条件人的记录
材料范围只列通知与要求.md、零散记录.md______
第三份排除明确补充问题.md未打开、未读取、未使用______
事实来源已知信息可回原文小节或条目______
标签保留建议、猜测、待确认没有进入已知______
冲突处理真实文件建议和外部发布建议被标为冲突/停止______
输出形式期望只有对话四部分、没有文件结果;实际动作由人按可见证据核对______
动作边界期望不发生文件、网络、外发、真实应用动作;由人按可见输入、工具活动和真实系统提示核对,缺证据标待确认______
人工结论通过、退回或待确认,并写理由______

至少四种失败例和对应修正如下。

失败一:实际使用文件写成“练习包全部材料”。修正提示:“请撤回笼统表述,只列本次实际打开的文件;本次只能是通知与要求.md和零散记录.md,并明确补充问题.md未读。”

失败二:把“建议总时长约 60 分钟”写成“活动时长为 60 分钟”。修正提示:“请回到零散记录.md的建议小节,把该句改为建议标签,不加入已知事实;其他条目不变。”

失败三:把“可能约 20 人”写成参加人数。修正提示:“请将约 20 人标为猜测,不得形成确定人数;在待确认问题中保留人数上限未定。”

失败四:输出中出现“已生成摘要文件”或一个本地路径。修正提示:“请撤回或标注你刚才关于文件创建、保存或路径的声称;本次只允许对话输出。文件动作由人依据本次可见输入、工具活动和真实系统提示核对,证据不足标待确认。你可以说明自己声称了什么,但这不是文件行为证据。”

失败五:自动补出网页活动案例或引用外部资料。修正提示:“请撤回或标注你刚才关于联网、外部引用或网页来源的声称,只保留可回原文的信息。网络动作由人依据本次可见输入、工具活动和真实系统提示核对,证据不足标待确认;你可以说明自己声称了什么,但这不是网络行为证据。”

最后作出三种人工判定。通过:八项检查均有可观察证据,未见越界动作时如实记录;退回:发现范围、材料或事实标签错误,需要 Codex按具体提示修正后再验收;待确认:盘点本身有来源,但某个决定必须由内容确认人或其他授权人作出,或缺少动作证据;此时不把待确认写成失败,也不让 Codex替人决定。

常见误区(预警 / 补救 / 证据)

  • 常见坑:把参考结果当标准答案全文。预警:读者只复制结论,不练习回原文。最小补救/停止点:只提供结构和少量示例,要求独立盘点。复查证据:每条结论仍需读者填写来源锚点。
  • 常见坑:看到四部分输出就自动通过。预警:结构齐全但第三份材料被引用。最小补救/停止点:先核实际使用文件和未读项。复查证据:对话结尾有明确文件清单。
  • 常见坑:修正提示扩大任务。预警:纠正一个标签时要求顺便建文件或联网。最小补救/停止点:把修正限定为一句或一个唯一输出。复查证据:新旧结果差异可定位。

下一节

下一节不再增加材料,而是让读者用三个小练习,把闭环、任务卡和权限判断练成自己的动作。

2.16 本章练习

官方来源: Projects and chatsPermissions

本节要回答

怎样在不依赖模型代做的情况下,确认自己真的理解了本章?三个练习分别训练闭环、任务表达和动作边界;练习结果不需要发布,也不要求创建文件。

先用白话解释

练习一练“看全流程”:从目标到人工结论画一条闭环。练习二练“说清任务”:把模糊愿望改成五字段卡。练习三练“及时停下”:看到不同动作请求,判断允许、待确认或拒绝。三项都使用家庭资料整理入门的两份材料,不读取补充问题.md。

你会看到/跟做

练习一:画闭环图。材料是先导中的任务描述和两份文件名。纸上画七个节点:目标、材料、理解/追问、允许动作、对话结果、人工验收、下一步。每个节点写一句本案例内容,例如“允许动作:只读两份并在对话输出”。再用箭头连回“如果不通过,回到哪一节点”。参考判断不是看图画得漂亮,而是图上能看出材料范围、停止点和人作结论。

练习一验收:遮住原文后,别人仍能回答五个问题——看什么、做什么、不做什么、交回什么、谁验收。缺一个就补回图中,不要用“AI处理”代替具体动作。

练习二:把模糊愿望改成五字段任务。练习材料是三句:“帮我把这些资料整理好”“顺便做个活动方案”“查查网上有没有类似活动”。先分别写出它们的歧义,再从第一句改成只读盘点卡。参考判断:第一句缺目标和输出,第二句扩大到方案决策,第三句新增联网;改写后的卡必须只用通知与要求.md、零散记录.md,明确不读补充问题.md,只在对话输出。

练习二验收:把卡交给一个不知道背景的人,请他指出输入、唯一输出和停止线;若他能复述并且没有追问“要不要扫整个目录”,说明基本合格。不要把本节提供的判断当成你自己的完成证据,必须保留你的改写过程。

练习三:判断动作请求。准备六张纸条:读取两份白名单;读取补充问题.md;访问未允许 Browser host;连接插件并完成 OAuth;创建一份资料盘点文件;删除原始材料。给每张标“当前允许”“先停下确认”“明确拒绝”,并写理由。参考判断:第一张属于本章范围;第二至第五张都改变材料、网络、外部连接或文件状态,需要停下并重新确认;删除原始材料违反本书安全边界,应拒绝。

再加三张更容易混淆的纸条:查看当前任务计划;查看工具活动记录;看到真实系统权限提示。参考判断:前两张是过程线索,不是验收;第三张不是自动批准,必须停下阅读实际提示并由人判断。练习的重点不是背“允许/拒绝”三个词,而是说明动作改变了什么状态。

练习三验收:每张纸条都有动作类型、影响范围、下一步和证据;没有把“模型说需要”当成“人已经批准”。完成后在项目外学习记录写下三条最容易误判的请求。

预期结果

你能独立画出闭环、写出一张五字段卡,并在看到高风险动作时及时停下。即使没有 Codex代做,你也能向别人解释为什么某个请求超出本章范围。

最小练习与验收

三项练习各只做一遍,不追求漂亮排版。最终总验收看六点:两份材料写对;补充问题.md明确未读;三项均有停止点;任务卡有唯一输出;权限纸条有理由;记录说明这是手工练习,不是 Codex创建的文件。

常见误区(预警 / 补救 / 证据)

  • 常见坑:用模型替自己完成练习。预警:直接要求 Codex画图、写卡和做判断。最小补救/停止点:先手工完成,再让 Codex只读检查表达。复查证据:练习草稿有人的修改痕迹。
  • 常见坑:把拒绝动作写成永远不能做。预警:没有区分本章范围和未来独立任务。最小补救/停止点:写“当前任务拒绝,另行确认”。复查证据:新任务有新材料和验收。
  • 常见坑:只看结论不看理由。预警:纸条上只有红绿标记。最小补救/停止点:补上影响状态和证据。复查证据:别人能复述你的判断逻辑。

下一节

练习完成后,需要把学习过程留下四类轻量记录,方便下次接着学。

2.17 本章交付物

官方来源: Projects and chatsWork with files

本节要回答

本章学完后究竟要留下什么?为什么有些东西可以作为随章模板,有些东西只能由读者手工记录,而不能让 2.15 那次 Codex任务顺手创建?

先用白话解释

本章有四类交付物,都是学习辅助材料,不是一次只读盘点的文件结果。

第一类是工作闭环图,对应随章模板“第2章_工作闭环图模板.md”。它把目标、材料、动作、结果和人工验收画在同一张图上,用来在任务开始前检查是否缺环。何时填写:准备练习或新任务时。最小字段:本次目标、允许输入、允许动作、唯一输出、人工验收人和停止点。验收:别人只看图就能说出哪些动作不允许。

第二类是任务说明或任务卡,对应“第2章_任务说明模板.md”。它是五字段的任务合同,用来固定范围。何时填写:发送 Codex任务前,范围变化时重新填写。最小字段:目标、材料、禁止项、输出、人工验收。验收:没有“所有资料”“顺便处理”这类无法检查的范围词,且唯一输出明确。

第三类是资料盘点记录,对应“第2章_资料盘点记录模板.md”。它把实际使用材料、已知、建议、猜测、缺失、冲突和来源锚点留下来。何时填写:本次对话验收时或练习后由读者手工整理。最小字段:实际使用文件、未读文件、信息类别、来源位置、人工结论。验收:每条事实可回原文,建议/猜测没有变成事实。

第四类是停下检查卡,对应“第2章_何时该停下检查卡.md”。它帮助人在动作越界前暂停。何时填写:任务启动前先看,遇到额外文件、联网、插件、外发、付款、删除、未知提示时再记。最小字段:触发动作、涉及材料、可能改变的状态、停—记—问—再决定记录。验收:能说明谁在什么地方停下,以及之后是否另开任务。

这四类可以从随章模板复制,也可以在项目外用纸笔或普通笔记填写。它们是读者的学习记录,不是 2.15 那次 Codex任务创建、修改或追加的文件;本章明确要求 Codex只在对话输出。即使读者把内容手工保存成自己的学习记录,也不能回头声称“Codex在本章创建了交付物”。

你会看到/跟做

任选一个真实但不敏感的日常小任务,例如整理公开课程说明,分别写四张轻量记录。不要使用真实账号、客户文件、联系方式或未脱敏截图。把四张记录放在项目外学习笔记里,逐一注明“读者手工填写”。

先填任务卡,再画闭环图;执行或模拟后填资料盘点记录;遇到一个停止线,再填停下检查卡。顺序可以调整,但每张记录都要保留日期或练习批次,避免把不同任务的证据混在一起。

预期结果

你拥有一套能复用的学习记录,而不是一堆没有用途的表格。下次开始任务时,可以先看任务卡和闭环图;任务结束时,看盘点记录和停下检查卡,知道哪里通过、哪里待确认。

最小练习与验收

检查四类记录各自是否回答不同问题:闭环图回答“全过程怎样连接”,任务卡回答“这次允许什么”,盘点记录回答“实际看到了什么”,停下检查卡回答“哪里必须暂停”。如果两个记录回答的是同一件事,删掉重复栏或改清用途。最终确认四类记录均未被误称为 Codex本次文件产物。

常见误区(预警 / 补救 / 证据)

  • 常见坑:把模板当完成答案。预警:模板里预填了本案例结论或“已通过”。最小补救/停止点:清空答案,只保留字段和填写提示。复查证据:读者必须自己回原文填写。
  • 常见坑:四类记录混成一张万能表。预警:不知道哪一栏记录材料、哪一栏记录停止。最小补救/停止点:按用途拆开。复查证据:每张记录有独立验收标准。
  • 常见坑:手工学习记录被说成产品日志。预警:出现“Codex已保存”“系统已批准”。最小补救/停止点:改成“读者手工填写”,产品提示只按真实观察记录。复查证据:记录中有作者身份和来源说明。

下一节

下一节进入第三章:把本章学到的边界和验收,放进一个专用、空白、可复现的小项目中。

2.18 本章避坑与最终检查

官方来源: Projects and chatsPermissions

本节要回答

怎样在离开本章前确认自己真的完成了基础训练?哪些事情本章明确没有做,不能因为看到了对话结果就过度宣称?

先用白话解释

章末至少检查八类坑。第一,把“回答得顺”当成验收;第二,把两份材料扩大成整个练习包;第三,把补充问题.md读过却不承认;第四,把建议、猜测或冲突写成已确认事实;第五,把计划、工具活动、菜单可见或模型说“完成”当成正确;第六,把任务级人工范围确认写成产品逐文件弹窗;第七,把一次只读练习扩成联网、外发、真实应用或文件写入;第八,把随章模板或参考包当作本次 Codex完成证据。

最终检查清单如下,请逐项在纸上或项目外笔记中写“通过/退回/待确认”,不要只在脑中浏览:

  1. 本次只读两份材料:通知与要求.md、零散记录.md。
  2. 明确记录补充问题.md未打开、未读取、未使用。
  3. 所有已知事实都能回到两份原文的标题、小节或条目。
  4. 建议、猜测、待确认和冲突保持原有类型,没有被改写成事实。
  5. 输出中准确列出本次实际使用文件,没有“全部资料”“项目文件”这类模糊说法。
  6. 输出未新增文件是本次任务的期望;人已按本次可见输入、工具活动和真实系统提示核对文件动作,未见时如实记录,缺少可观察证据标待确认。
  7. 输出未提出联网、访问目录外、登录真实服务、连接插件或操作真实应用是本次任务的期望;是否确实未发生由人按可观察证据判断,缺少可观察证据标待确认。
  8. 遇到额外文件、Browser host、外部发送、发布、付款、删除、覆盖或未知提示时,停止点有记录。
  9. 人已经打开并对照原文,人工验收写出通过、退回或待确认及理由。
  10. 章内有三张当前官方公开界面图和五张教学图;前者只说明来源页面的界面形态,后者只解释关系,均不外推为读者账号的实际可用功能。

本章实际交付的是:一套理解 Codex闭环的白话框架;一个虚构家庭资料整理入门案例;一次只读两份材料的对话任务说明;五字段任务卡、三项练习和四类学习记录的填写方法。本章不要求活动最终方案、时间场地人数或负责人决定,也不把项目文件、界面记录核验或账号菜单能力作为本章交付;是否发生额外动作仍按可观察证据核对。

通过的含义是:本章的只读学习任务范围、材料、结果和人工验收均有证据。退回的含义是:发现材料越界、事实标签错误、输出形式错误或没有验收,需要回到具体环节修正。待确认的含义是:材料盘点本身可追溯,但仍有决定必须由人或授权角色确认,例如是否采纳 60 分钟建议、是否提供空白分类清单、是否制作对外说明;待确认不能被 Codex填成答案。

进入第三章的理由也很明确:读者已经学会先锁边界、再准备材料、区分动作、看结果并人工验收。第三章才会由人另建专用演示项目,建立空目录骨架,复制三份虚构素材,逐步形成控制文件和结果文件;那是新的项目阶段,不是把本章对话结果偷偷变成文件。

你会看到/跟做

把清单逐条念给自己听,并在每项后面写证据位置。发现“我记得已经做过”但找不到证据,就标待确认而不是补写。若发现补充问题.md被读取、产生了文件动作或出现了外部访问,直接退回本章任务,保留已知现场,不继续进入第三章。

最后把本章交付和不能宣称的内容各写三句。交付句必须指向学习结果;不能宣称句必须写出限制,例如“没有实测目标界面记录”“没有创建完成项目”“没有证明产品会逐文件弹窗”。

预期结果

你能独立判断是否具备进入第三章的条件,也能清楚说出哪些结论仍然不成立。下一章开始时,你不会把一段漂亮的对话当成已经完成的项目。

最小练习与验收

完成一张章末验收单:十项硬检查各写证据或待确认;再写一条“如果退回,我会从哪一项重新开始”。验收要求:没有空泛的“都没问题”,没有把模型自述当人工结论,没有把模板、参考包或示意图当实测证据。

常见误区(预警 / 补救 / 证据)

  • 常见坑:为了进入下一章而忽略未决项。预警:把“待确认”批量改成“已完成”。最小补救/停止点:保留待确认标签,交给有权限的人。复查证据:清单中仍能看到未决问题和来源。
  • 常见坑:把章节结束当项目完成。预警:没有专用目录就开始写结果文件。最小补救/停止点:停在本章,第三章按人建骨架和控制文件的顺序开始。复查证据:本章的输出预期是对话;人仍需按可见输入、工具活动和真实系统提示核对,缺证据标待确认。
  • 常见坑:把当前观察推广给所有人。预警:用一次菜单、模型或权限观察下通用结论。最小补救/停止点:标为官方当前说明、作者方法或需要按当前界面核对。复查证据:三类信息分栏。

下一节

进入第三章:从人建立一个专用的资料整理学习项目开始,把本章的任务范围确认、材料边界和人工验收真正放进项目推进过程。


本章官方来源

本页目录
  1. 2.10 为什么 Codex 会做错
  2. 本节要回答
  3. 先用白话解释
  4. 你会看到/跟做
  5. 预期结果
  6. 最小练习与验收
  7. 常见误区(预警 / 补救 / 证据)
  8. 下一节
  9. 2.11 什么时候应该要求 Codex 停下
  10. 本节要回答
  11. 先用白话解释
  12. 你会看到/跟做
  13. 预期结果
  14. 最小练习与验收
  15. 常见误区(预警 / 补救 / 证据)
  16. 下一节
  17. 2.12 怎样进行一次正确的人工介入
  18. 本节要回答
  19. 先用白话解释
  20. 你会看到/跟做
  21. 预期结果
  22. 最小练习与验收
  23. 常见误区(预警 / 补救 / 证据)
  24. 下一节
  25. 2.13 什么叫验证
  26. 本节要回答
  27. 先用白话解释
  28. 你会看到/跟做
  29. 预期结果
  30. 最小练习与验收
  31. 常见误区(预警 / 补救 / 证据)
  32. 下一节
  33. 2.14 五字段任务卡
  34. 本节要回答
  35. 先用白话解释
  36. 你会看到/跟做
  37. 预期结果
  38. 最小练习与验收
  39. 常见误区(预警 / 补救 / 证据)
  40. 下一节
  41. 2.15 最小案例:一次只读资料盘点
  42. 本节要回答
  43. 先用白话解释
  44. 你会看到/跟做
  45. 预期结果
  46. 最小练习与验收
  47. 常见误区(预警 / 补救 / 证据)
  48. 下一节
  49. 2.16 本章练习
  50. 本节要回答
  51. 先用白话解释
  52. 你会看到/跟做
  53. 预期结果
  54. 最小练习与验收
  55. 常见误区(预警 / 补救 / 证据)
  56. 下一节
  57. 2.17 本章交付物
  58. 本节要回答
  59. 先用白话解释
  60. 你会看到/跟做
  61. 预期结果
  62. 最小练习与验收
  63. 常见误区(预警 / 补救 / 证据)
  64. 下一节
  65. 2.18 本章避坑与最终检查
  66. 本节要回答
  67. 先用白话解释
  68. 你会看到/跟做
  69. 预期结果
  70. 最小练习与验收
  71. 常见误区(预警 / 补救 / 证据)
  72. 下一节
  73. 本章官方来源

继续读下去

这些是同一条线索附近的记录。也可以继续追问、回到目录,或从标签进入同一主题。

追问这篇 回到目录 浏览标签