三万道题为什么不让 AI 写:把重复繁重的活交出去的正确切法

我们要批量生产三万道题,最后选的方案是让 AI 只做它做得好的那一层,答案由程序重算、图重新渲染、逐道跑十三项检查。这篇讲我们试过让 AI 直接写题、以及它为什么没通过。

「把重复繁重的活交给 AI」这句话,听起来的意思是:这活原来谁干,现在让 AI 干。

真做下来会发现,几乎所有成功的落地都不是这样。**成功的落地是把这件活重新切一遍,让 AI 只做它做得好的那一层,其余的交给程序和人。**切得对,量能上去且质量稳定;切得不对,你会得到一堆需要人逐条返工的东西——返工的工夫比自己做还多。

我们要批量生产三万道练习题。这篇讲我们怎么切的,以及我们试过的、更直觉的那种切法为什么没通过。

先说结论:三层

第一层  模板(代码)  参数空间 + 求解函数 + 图形参数 + 干扰项   → 正确性
第二层  人           选参数 + 写题干 + 写解题思路              → 教学意图
第三层  检查(代码)  十三项确定性检查                          → 兜住前两层的疏漏

关键的一条设计:**第二层里没有任何数值结论。**答案、选项、干扰项、配图,全部由第一层算出来。

所以「人写错了」在结构上影响不到答案。这不是对人没信心,是让正确性不依赖任何人当天的状态。

试过让 AI 直接写题,它没过

最直觉的切法是:把要求告诉模型,让它写题,然后检查。

我们真跑过这条路。模型能过检查,答案也对。但它写出来的是这些:

它实际写出的东西 问题出在哪
「质量为四公斤的滑雪者」 五道里三道,人的体重不是人的量级
「滑雪者与雪坡的动摩擦因数取零点四五」 真实值在零点零五到零点一之间,懂行的一眼看出是编的
自己补一个三角函数近似值,而求解器用的是精确值 题干说的和答案依据的不是一回事
五道里四道都是「滑雪者」 拿到候选永远挑第一个

注意这几条的共同点:每一条都是我们事后加了一道检查才拦住的。

而这正是问题所在——检查只能拦住已经想到的。第一次是体重不对,第二次是摩擦因数不对,第三次会是什么?你不知道。每一道新检查都是被一次真实事故换来的。

如果这批产出是发给学生、用来判断「他会不会」的依据,那「大概率对」不够。所以这条路先放下了。让模型写题的代码还留着,等这套规范磨得足够稳、覆盖面够宽,再考虑让它按规范批量出题。

**这里的判断标准值得单独说:不是「AI 能不能做」,是「做错的代价谁承担、错了能不能发现」。**同一个能力,在能当场核对的场景里可以放手用;在错误会被下游安静放大的场景里,就得换一种切法。

换了之后,AI 还做什么

它做两件真正做得好的事。

**一是设计情境。**同一个考点,换成传送带、换成电梯、换成推箱子——这是语言和常识的活,模型比人快得多。人只需要在候选里挑,并且否掉不合常识的那些。

**二是从大量真题里帮人读出规律。**但这里有一条限制:读题的工具只负责把题捞出来排好版,不分类、不打标签、不调用模型。因为自动分类会给出一份看起来很整齐、但把两类完全不同的题混作一类的表——而那种错,恰恰是这一步要防的。

最贵的一课:检查保证不了「这道题该出」

第一批十道手写题,形式上全部通过了所有检查。它们仍然是废的。

原因是跳过了第零步:先读母题,搞清这个知识点在真实考试里到底考什么。

那批题挂在「摩擦力」上。真实的三十来道相关真题里,传送带模型占三成、叠放和板块占两成多,而我写的那类题只对应其中一道——那一道还不给关键参数。

检查只能保证「这道题是对的」,保不了「这道题该出」。

前者是形式问题,代码能判;后者是判断问题,只能靠先读原始材料。

这一条推广开来是:**任何自动检查体系都有一个它照不到的维度——「这件事值不值得做」。**你的检查越完善,越容易忘记这一点,因为满屏的绿色会让人觉得万无一失。

我们的处理是把它写进流程:读母题是第零步,不能跳;归纳要写下来,至少包含真实考点分布、真实易错点(从错误选项和解析里读出来的,不是想当然的)、该建什么模板、以及哪些考点根本不适合模板生成。最后这条要明说,因为承认边界比假装全覆盖有用。

检查怎么设

十三项,逐道跑,任何一项不过,这道题就不发。三条原则:

**一、检查自己重新推导,不采信「我已经保证了」。**那是最容易烂掉的一类保证。

**二、检查不调用 AI。**用 AI 验 AI 会得到两个模型一起自信地错。

**三、检查自己炸了也算没过。**绝不因为检查本身出错就放行。

还有一条更重要的:**明确写出哪些地方没有设检查。**语言通不通顺、难度标注准不准、情境合不合理只覆盖了一部分——这些我们在文档里专门列出来。写明白比假装覆盖全了强:读的人知道哪里薄,才知道哪里要自己多看一眼。

最后是那个所有出题侧检查都判不了的东西:**这道题区不区分学生。**一道九成人都做对的题能通过每一项检查,但发它收集不到任何信息;一道正确率低于瞎猜的题同样能通过,而它多半是坏的——选项有歧义、题干漏条件、或者标准答案本身就错了。

这个信号只有一个来源:学生真的做过。所以它不在出题侧解决,从真实作答记录里回来。

可以搬走的三条

**一、先问「AI 在这件事里做哪一层」,别问「AI 能不能做这件事」。**大多数活里,AI 适合做的是生成候选和读材料,不适合做的是给出最终的、下游要依赖的结论。

**二、让正确性由确定性的东西保证。**答案由程序算、图由程序渲染。这样人和模型的疏漏都影响不到结果对不对。

**三、检查是兜底,不是设计。**只靠加检查来提质量,你会永远在追已经发生过的事故。真正省事的是把流程切成「那类错误在结构上不可能发生」。