你怎样判断 AI 真的完成了任务?
站方讨论:当 AI 报告“已完成”,你依据哪条证据接受交付?用“任务约定、完成说明、实际证据、证据缺口、当前判断、下一步”记录一次真实经历,也欢迎说明仍不能确认的部分。
执行信息
- 测试环境
- 通用任务交付讨论;虚构示例;不涉及特定产品功能或真实实测
- 输入
- 请查看正文中的输入说明
- 产出
- 请查看正文中的产出说明
- 实测结果
- 请以作者提供的实测记录为准
AgentField 编辑整理|站方发起讨论。下文示例为虚构情境,不是用户投稿或真实测试;欢迎补充你亲自经历、可以脱敏说明的一次任务。
当 AI 给出“已完成”时,你通常看什么才会接受结果?一次确认、一份文件,还是自己走完目标流程?这次讨论想收集的是具体判断过程:你原先要什么,拿到了什么证据,最后怎样决定继续使用或补查。
不必展示复杂项目,也不必提供成功故事。“我还不能确认”同样值得讨论。请只描述自己实际观察的部分,不替别人补结论,也不要把示例填成经历。
先选一个有边界的任务
最好选一次能够单独说清的小任务,例如整理一份可交付文件,而不是“让 AI 帮我完成整个项目”。写下当时约定的结果和你负责核对的范围;如果约定后来变过,也说明变化发生在哪一步。
我们关心的是你如何接受交付,不是用一次结果给某个工具下总评。任务范围、输入和检查方式不同,不能只凭一句“成功”或“失败”横向比较。
用三个问题审视“已完成”
- 证据对应的是这次结果吗? 检查文件、版本或记录是否来自当前任务,而不是上一轮产物。旧截图、旧文件即使真实,也可能不能说明这次修改。
- 证据支持到哪一步? 有产物、能打开、内容符合要求、可以交给下一位使用,是不同层次。分别写清已确认和未检查的部分,不用其中一项代替全部。
- 谁做了哪项核对? 区分“AI 的完成说明”“你实际看到的结果”和“其他人复核的结果”。重复一句完成承诺,不会补上缺失的验证。
这三问是讨论建议,不是要求所有任务都做同样的检查。你可以说明为何某一步对这次交付足够,以及哪些剩余风险可以接受。
可以按这个格式留下一个判断
任务与约定:希望得到什么,做到哪一步算交付
声称完成:对方报告完成了哪些具体内容
实际证据:我亲自看到了什么,来自哪一轮结果
证据缺口:哪一项没有检查,或者结果互相矛盾
当前判断:已确认完成 / 部分完成 / 有产物但待验证 / 未完成
下一步:补哪项检查,谁来做,什么结果会改变判断
这些判断词只用于表达证据状态,不是平台新增的任务状态功能。分享时删除密码、令牌、私人文件内容和无关身份信息;无法公开原件时,写明证据的类型与范围即可。
虚构示例:任务约定交付一份能打开且内容完整的说明文档。完成说明称“文件已生成”,目录中确有新文件,但尚未用目标软件打开检查。此时可以说“已确认产物存在,能否打开及内容是否完整待验证”。下一步是核对这两个条件,而不是反复问一句“你确定做完了吗”。
讨论时,怎样让下一条回复有用
读到别人的记录,可以指出最小的证据缺口,说明为什么这项检查会影响判断。先围绕当时的交付约定讨论,别悄悄增加一整套新要求;确需提高标准时,把新增要求单独说明。
如果后来补验通过或发现问题,欢迎在原记录后补上时间、新增证据和修订后的判断,保留前后变化。我们希望积累可借鉴的判断方法,而不是堆积“效果很好”的结论。
你最近一次接受、暂缓接受或退回 AI 交付,依据的那条关键证据是什么?