可判定的输出不是“看完文章后写一篇总结”,而是把文章里的判断条件、动作和验收标准拆成一个有明确输入、明确产物、明确通过条件的任务。一个可行的设置是:先从论坛帖中选出一段带条件的建议,再让做题者用给定素材产出可被第三方复核的中间物,例如判断表、修改前后对照或决策记录。只要通过条件不依赖“感觉做得对”,这道题就能被判定。下面说明这种设置成立的条件、一个常见反例,以及下一步怎么改。
论坛文章通常给的是经验性建议,比如“标题要包含用户会搜的表达”“内页要靠近主题词”“旧内容先补再删”。这类建议无法直接判对错,因为同一段文字在不同站点、不同意图下都可能成立或不成立。可判定的实操题要判的不是结论,而是做题者有没有留下足以复核的决策痕迹。
具体做法是把文章拆成三层:
当三层都写清楚,题目就从“理解文章”变成“在给定条件下做出可检查的选择”。判定成本也随之下降,因为复核者只看产物,不需要重新读一遍原文。
不是所有输出都能判定。纯文字感想、开放式计划、没有输入素材的“请优化这个页面”都不合格,因为复核者无法区分“做对了”和“写得像做对了”。以下三种产物形式在实践中更容易判定。
给出一组页面或一组帖子,让做题者逐条填写“判断依据、选择动作、放弃的动作”。判定标准是每条选择是否引用了文章中的条件,而不是是否与某个标准答案一致。这样即使做题者选了不同方向,只要条件引用成立,也能通过。
要求做题者标出修改前的内容位置和修改后的内容位置,并注明改动理由来自文章的哪一条判断。判定时检查两点:改动是否真实发生,理由是否与文章条件对应。理由缺失或与条件无关,即使改得漂亮也不通过。
让做题者写出一个被放弃的方案及放弃原因。可判定的关键在于原因是否指向文章提到的限制条件,例如意图不匹配、页面类型不符、证据不足。只写“感觉不合适”不算通过。
一个常见错误是:为了让判定简单,把题目设计成只有一个标准答案,例如“标题必须包含某个词,且只能出现一次”。这种题看起来容易判,但它会让结论失效,因为文章本身给的是条件性建议,不是固定公式。一旦做题者遇到不同意图或不同页面类型,唯一答案就会与文章条件冲突,题目反而在训练错误习惯。
判断是否落入这个反例,可以看一个信号:如果做题者只要找到文章里的某句话照抄就能通过,这道题就没有训练决策,只训练了检索。可判定的输出应当允许不同选择,但要求每个选择都能追溯到文章条件,并且产物本身可被复核。
另一个失效情形是输入素材不足。题目要求做题者判断“这个页面该不该改”,却没有给出页面当前状态、目标意图或已有内容范围。此时任何判定都只能靠猜测,复核者也无法区分判断依据是否成立。遇到这种情况,先补输入,再谈判定。
不要一次把整篇文章转成十道题。先选文章中一条带条件的建议,构造一道最小实操题,只要求一个产物、一个复核点。做完后检查两件事:复核者能否在不读原文的情况下判断通过与否;做题者能否说明自己的选择来自哪条条件。如果这两点都成立,再增加题目数量或提高复杂度。如果不成立,优先修改输入素材和验收标准,而不是增加题目难度。
假设你从论坛帖里选出的建议是“旧内容先补再删”,最小题可以这样设置:给出一段旧内容和一条目标意图,要求做题者输出补写位置、补写理由、以及暂不删除的原因。复核者只检查理由是否引用文章条件、补写位置是否具体。通过后再进入下一题。这样每一步都有可判定的产物,下一步动作也由上一题的复核结果决定,而不是由感觉决定。