AI 提议,规则裁决
让强模型提出下一步的方案,再由一套纯确定性的校验去判它能不能用。校验不过、置信度不够、或者任何一处报错,就退回规则版本。这样接上 AI 之后,系统不可能比原来的规则更不安全。
Agent 应用,是让多个 AI 分工跑完一条流程:有的干活、有的复核、有的汇总,卡住了能看出卡在哪一步。它和单个对话框的区别不在模型更强,而在于流程的顺序、检查和留痕是写死在系统里的,不是写在提示词里的建议。
复杂的活不是一问一答能解决的 —— 要拆步骤、要中间检查、一步错后面全废。这正是单个对话框吃不下的那类工作。
让强模型提出下一步的方案,再由一套纯确定性的校验去判它能不能用。校验不过、置信度不够、或者任何一处报错,就退回规则版本。这样接上 AI 之后,系统不可能比原来的规则更不安全。
所有候选行为登记在一处,按优先级逐个评估,该出手才出手、该闭嘴就闭嘴。这一层零 AI 参与 —— 决定「要不要说话」的必须是确定性的,否则没人能预测它下一句会干什么。
为什么在这一刻做这件事、当时看到了哪些信息、其他候选为什么被跳过,全都记下来。对同一个学生反复不奏效的行为会被跳过 —— 依据是真实结果,不是打分。
一步错后面全废的解法不是让模型更小心,是在每一步之间插入确定性检查,并且允许「这一步我不敢自动放行」——那就交给人。
一条在产品运行时里,一条在内容生产侧。都不是示意图。
学生每一次动手都会触发一轮评估:该不该出手、出手说什么、用哪种台阶。提议可以来自模型,但要不要出手由确定性的仲裁决定,并且全程留痕。
从抽样决定要不要逐条审,到自动检查结构与出处,再到人工核对图示,最后入库前再比一次字段增减。中间那道人工检查刻意不许用模型代劳。
有一版设计是让讲课的模型自己在输出里报告当前进行到哪一步,系统据此推进。三次真人全流程跑下来,快模型和强模型都会漏掉或放错那个标记 —— 于是改成:状态由确定性的流程自己维护,模型只负责把话说好。让模型自报状态,等于把流程的正确性押在它的自觉上。
写的是我们自己怎么做、为什么这么做、哪次做砸了。
需要说清楚的一点:上面这些系统目前都跑在我们自己的产品里。我们没有对外交付过的客户案例,也不会拿别人的名字当背书。