Agent 应用

Agent 应用:把多个 AI 当员工编排起来,跑完一整条流程。

Agent 应用,是让多个 AI 分工跑完一条流程:有的干活、有的复核、有的汇总,卡住了能看出卡在哪一步。它和单个对话框的区别不在模型更强,而在于流程的顺序、检查和留痕是写死在系统里的,不是写在提示词里的建议。

复杂的活不是一问一答能解决的 —— 要拆步骤、要中间检查、一步错后面全废。这正是单个对话框吃不下的那类工作。

一个对话框吃不下的活长什么样

  • 流程有先后:上一步的产物是下一步的输入,顺序错了结果就是废的。
  • 中间必须有人复核:错误不会自己暴露,越往后越贵。
  • 出事要能查:跑砸了得说得出是哪一步、当时看到了什么、为什么那么决定。

我们的做法

AI 提议,规则裁决

让强模型提出下一步的方案,再由一套纯确定性的校验去判它能不能用。校验不过、置信度不够、或者任何一处报错,就退回规则版本。这样接上 AI 之后,系统不可能比原来的规则更不安全。

谁该出手,由仲裁决定

所有候选行为登记在一处,按优先级逐个评估,该出手才出手、该闭嘴就闭嘴。这一层零 AI 参与 —— 决定「要不要说话」的必须是确定性的,否则没人能预测它下一句会干什么。

每次决定都留痕

为什么在这一刻做这件事、当时看到了哪些信息、其他候选为什么被跳过,全都记下来。对同一个学生反复不奏效的行为会被跳过 —— 依据是真实结果,不是打分。

多道检查串在流水线上

一步错后面全废的解法不是让模型更小心,是在每一步之间插入确定性检查,并且允许「这一步我不敢自动放行」——那就交给人。

两条真在跑的流水线

一条在产品运行时里,一条在内容生产侧。都不是示意图。

573 / 573个知识点配了动手练习

运行时:AI 导师的行为中枢

学生每一次动手都会触发一轮评估:该不该出手、出手说什么、用哪种台阶。提议可以来自模型,但要不要出手由确定性的仲裁决定,并且全程留痕。

4道检查

生产侧:教材内容的提取流水线

从抽样决定要不要逐条审,到自动检查结构与出处,再到人工核对图示,最后入库前再比一次字段增减。中间那道人工检查刻意不许用模型代劳。

我们失败过的地方

有一版设计是让讲课的模型自己在输出里报告当前进行到哪一步,系统据此推进。三次真人全流程跑下来,快模型和强模型都会漏掉或放错那个标记 —— 于是改成:状态由确定性的流程自己维护,模型只负责把话说好。让模型自报状态,等于把流程的正确性押在它的自觉上。

需要说清楚的一点:上面这些系统目前都跑在我们自己的产品里。我们没有对外交付过的客户案例,也不会拿别人的名字当背书。

有想交出去的活?
说说它长什么样。

聊聊你的场景