NOTES
实践笔记
我们自己做 AI 系统时踩过的坑和定下的做法,第一手写下来。不写方法论综述,只写我们真做过的那一件事:怎么做的、为什么这么做、哪次做砸了。每个数字都指得出是怎么数出来的。
AI 落地应用
看这条线 →- 一份素材,四个平台:把内容生产做成一条能重复跑的产线内容生产是最像「重复繁重」的活,也是最容易做成一次性演示的活。这篇讲我们怎么把它拆成计划、校验、试产、复盘四步,以及为什么发布前的那道打分闸必须在渲染之外单独存在。
- 别让模型自报状态:两次事故和一条设计原则让模型在输出里顺带汇报自己进行到哪一步,是把流程的正确性押在它的自觉上。两次真实事故——一次是标记漏掉,一次是报错被吞成一个编造的分数写进了学生档案。
- 三万道题为什么不让 AI 写:把重复繁重的活交出去的正确切法我们要批量生产三万道题,最后选的方案是让 AI 只做它做得好的那一层,答案由程序重算、图重新渲染、逐道跑十三项检查。这篇讲我们试过让 AI 直接写题、以及它为什么没通过。
Agent 应用
看这条线 →- 一步错,后面全废:一条内容流水线上的四道检查多个 AI 串成流水线,最贵的错误是早期一个不起眼的偏差被后面每一步放大。我们在教材内容提取上设了四道检查,其中最关键的一道刻意不许自动放行——以及为什么「让模型自己比对一遍」会失效。
- 让 AI 当评审员的四条纪律:判产物,不判声称用 AI 检查 AI 的产出,是流水线里最诱人也最容易自欺的一步。四条纪律把它从「又一个好看的分数」拉回可用的检查——其中最要命的一条是:证据不给到评审手里,它不会说不知道,它会编。
- LLM 提议,规则裁决:让 AI 主动出手,又不让它决定该不该出手一个会主动开口的 AI 导师,最危险的不是说错话,是在不该说话的时候说话。我们把「说什么」交给模型,把「要不要说」留给一套零 AI 参与的确定性仲裁。
