三十份作文、四个班的程序作品、上百张学习单,教师很容易产生一个直接的想法:把作业交给 AI,让它批完并写评语。真正危险的不是模型偶尔看错一题,而是它把“看到了什么”“怎样理解”“最后怎么评价”一次完成,教师只剩下一列看似整齐的分数。
批量处理作业时,AI 最适合先做整理员:统一文件、提取可核对的证据、标出缺失和异常、归纳共性问题。评价与反馈应建立在这些证据上,由教师完成规则解释、边界判断和最终确认。这样既能减少重复劳动,也不会把专业判断藏进黑箱。

先把三个动作拆开:提取、解释、决定
提取是从作品中找出可观察内容,例如是否提交源文件、是否有两组对比数据、程序能否运行、结论是否引用了材料。解释是判断这些内容说明了什么,例如学生可能不理解变量,还是只漏传文件。决定则是给等级、写反馈或安排补做。
AI 在第一步通常效率最高。它可以按固定字段扫描大量文件,并把证据位置一并记录。第二步需要结合任务设计、学生年龄和课堂经历,模型只能提出可能解释。第三步会直接影响学生,必须由教师承担最终责任。
如果一条指令同时要求“检查全部作业、判断掌握情况、给分并写个性化评语”,三种动作就混在一起。改成分阶段任务,任何错误都更容易发现和追溯。
批量开始前,先固定任务要求和证据字段
不要让 AI 读完作业以后自己猜“什么算好”。教师先提供原始任务单、评分规则、课堂上实际讲过的要求和允许使用的工具。如果评分规则还不清楚,应先把规则补齐,而不是让模型从优秀样例反推。
证据字段要写成能观察的项目。信息科技作品可以包括:文件是否能打开、主要功能是否运行、是否保留关键操作过程、测试记录是否完整、作品说明能否指出一次修改。作文可以记录:题目要求是否回应、关键事实是否有来源、段落结构、修改痕迹和需要教师判断的表达。
每个字段还要约定三种状态:已找到、未找到、无法确认。没有看到证据不等于学生一定没做;文件损坏、图片模糊或命名错误,都应进入“无法确认”,留给教师处理。
先做副本和匿名化,再交给工具
原始作业不直接批量改名、转换或覆盖。先保留只读备份,再建立处理副本。为每份作品生成内部编号,把姓名、班级、学号、联系方式和照片等非评价所必需的信息移出工作文件。编号与学生身份的对应表单独保存,不交给模型。
文件格式也要统一。把无法读取的文件列成异常清单,不要静默跳过;图片作业记录页数和清晰度;程序作品保留原目录结构,不随意删除依赖文件。批量任务开始前先用三到五份样本跑一遍,确认字段和输出格式没有偏差。
如果使用云端服务,还要先确认学校数据规则和产品的数据处理方式。涉及未成年人作品时,能在校内环境处理的就优先在校内处理;无法匿名化的材料不要因为“只用于批改”就默认可以上传。
让 AI 只输出“证据矩阵”
证据矩阵一行对应一份作业,一列对应一个观察字段。每个结论后面附证据位置:文档页码、段落开头、文件路径、程序运行结果或截图编号。找不到就写“未找到”,不能补写学生可能想表达的内容。
例如,程序作品的“测试记录”一列,不是只写“较完整”,而是写“在说明文档第二页发现三组输入与输出;未说明异常情况”。作文的“事实依据”一列可以写“第二段引用校园用水数据,但未标明来源”。这些句子教师能够回到原作业核对。
矩阵还应有“工具置信度”和“需人工查看原因”两列。低清图片、混合手写、代码无法运行、多个文件对应不上、同一句话可能有两种理解,都自动进入人工队列。

先看异常,再看共性,不急着逐份打分
批量结果出来后,第一轮复核先处理异常:文件打不开、证据冲突、工具置信度低、可能涉及抄袭或不当内容的作品。高风险结论不能由 AI 自动下定论,更不能直接通知学生。
第二轮看全班共性。把证据矩阵按字段统计,找出哪些要求大多数学生完成,哪些环节集中缺失。例如,程序能运行但测试记录普遍不足,说明下一课可能要补“怎样证明程序可靠”,而不是给三十名学生重复写同一句评语。
第三轮才进入个体评价。教师可以按高、中、低和不确定四组各抽样若干份,检查 AI 提取是否稳定。如果某一字段误判明显,应修正规则并重新处理整批,而不是手工修几个单元格后继续相信剩余结果。
一张流程表规定 AI 到哪里停手
这张表应写进批量处理说明。AI 到“评价建议”必须停下来,任何分数、等级、评语和补做通知都先进入草稿,不直接写回成绩系统,也不自动发送给学生或家长。
评语要引用证据,也要保留教师语境
AI 可以根据已确认的证据生成反馈草稿,但每条反馈至少包含三部分:作品中已经做到的具体内容、需要改进的一个重点、下一步可以执行的动作。避免“很有创意”“继续努力”这类无法指导修改的句子。
同一证据在不同学生身上可能需要不同语气。初次尝试失败和反复忽略要求不是一回事;课堂上因设备故障没有保存,也不能等同于没有完成。教师掌握这些背景,应在发布前修改措辞和要求。
反馈也不宜暴露模型推断。不要写“AI 判断你缺乏逻辑能力”,应回到作品:“第三步没有记录测试结果,读者无法确认程序在不同输入下是否有效。请补两组测试并写出发现。”
保存审计线索,不保存一座新的隐私仓库
一次批量处理至少保留任务规则版本、所用证据字段、处理日期、工具与模型、人工抽样结果、最终修改人。以后学生提出疑问,教师能说明评价依据和修改过程。
但不必无限保存模型看到的全部文件和中间对话。处理结束后,按学校规则删除临时副本、上传缓存和无用日志;编号对应表与评价结果分开管理。工具账号、操作日志和作业数据也不要混在教师个人网盘中。

联合国教科文组织的教师 AI 能力框架强调以人为中心、伦理与教师能动性;OECD 2026 年数字教育展望也指出,生成式 AI 可以辅助评价,但教学相关性、真实性、公平性和目标一致性仍需要人工复核。落实到一线工作,就是让 AI 先把证据摆整齐,让教师更快看见问题,而不是让模型替教师决定学生得到了什么评价。
参考资料
批量处理作业时,AI 应该先整理证据
本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。
评论交流
欢迎留下你的想法