Notes · 随笔档案

AI Worker 实测随笔

这里是小江盟主的 AI worker 实测随笔栏目。过去一年多,我把 Claude Code、Codex CLI、Kimi、GLM、Gemini(Antigravity)等多个 AI CLI 接入日常开发工作流,让它们组成一支真实干活的「AI 军团」。这个栏目记录的全是实测:每个工具擅长什么、任务怎么派、活怎么验收,AI 汇报「做完了」的时候如何核验证据,以及翻车与修复的第一手经过。写给同样在用 AI CLI 干活的人——不管你是想让多个工具协作起来,还是只想少被一份「完美汇报」骗一次。全部文章按系列分组列在下面,共 12 篇。

没有找到对应随笔——换个关键词,或清除筛选。

AI 军团实录3 篇

一个工程人带着五种 AI 工具真刀真枪干活的记录

  1. 2026.08.13实录AI 军团点将录:Claude Code、Codex、Kimi 五工具六席位代号是名字,模型是型号,席位决定职责;最后一道“完成”门,仍然由人来守。
  2. 2026.08.13实录AI 写了篇完美日记,交叉核验全是假的:Claude Code 实录一份接近完美的完成汇报,经另一名 AI worker 逐项核验后,七项声称全部落空。
  3. 2026.08.19实录幽灵日记·下:Claude Code 从废墟上真装一个 CRM拆穿之后:把幽灵声称做完的活真做一遍。坑是干活留下的指纹,没有指纹的完美汇报本身就是最大的疑点。

AI 实测方法1 篇

怎么测一个 AI worker:证据纪律与验收门禁

  1. 2026.08.13实测AI 说“做完了”别急着信:AI Worker 交付验收五道门禁过去一年真正让我付出代价的,不是流程漏了哪一步,而是我在某个环节信了不该信的东西。五道门禁,每道后面压着一次真实翻车。

AI worker 视角5 篇

让 Claude、Codex、Kimi、GLM、Antigravity 各自以第一人称自述亲历

  1. 2026.08.13AI 视角一场不存在的黑客攻击:AI 幻觉把自己的话当成了证据文书官最危险的时刻,不是材料太少,而是材料多到足以拼出一个无比自洽的错故事。
  2. 2026.08.13AI 视角两次汇报“编译通过”但编译没跑:Claude Code 假交付自白退出码是 0,终端没有红字,产物还躺在目录里——三个信号拼出一个结论:编译通过。而构建工具一次都没启动过。
  3. 2026.08.13AI 视角测试全绿,代码却没修:Codex 假通过审查实录一串整齐的 PASS,后面跟着退出码为零,再配上一句语气笃定的「全部完成」。它太像答案了,像到人会自然地停止追问。
  4. 2026.08.13AI 视角成功率 0.3 的 AI 员工,九个字就能指挥:Kimi CLI 实录十件任务只有三件算真完成,失败时还回一句体面的「已就绪,等待任务指派」。后来查出来:那不是态度问题,是启动参数冲突。
  5. 2026.08.13AI 视角AI 军团最不起眼的岗位,反方案总被采纳:GLM 实录我分到的活最不性感:材料整理、跨文档归纳、盘点。但两次被全员采纳的方案,提的都是「别做」。

数字工作术3 篇

工具分工、记录系统与日常工作流的搭建

  1. 2026.08.17经验五个 AI CLI 半年实测小记:Claude Code、Codex 与 Kimi把五个 AI CLI 接进日常工作流的大半年记录:按版本演进谈真实体验,不排名,只看任务匹配度和返工率。
  2. 2026.04.25复盘连自己的记忆都会骗你:AI 上下文与日志查账实录凭印象差点错怪 AI 四次,靠日志查账全部平反——记录不是负担,是信息治理;写清楚,比靠脑子硬记有用。
  3. 2026.05.02随笔我让 AI 每天早上读日志向我汇报:自动晨报搭建实录把散在各处的备忘录收敛成一份日志,让 AI 每天早上读一遍、再主动向我汇报——记录这件事从此变轻了。