中文

层次化教学监督:面向可靠 AI 辅导的多智能体对抗框架

多智能体系统 2025-12-30 v1 人工智能

摘要

大型语言模型 (LLM) 越来越多地被用作自动辅导员以弥补教育者不足,但它们常常在教学推理方面失败,频繁验证错误的学生解决方案(迎合主义)或提供过于直接的答案以阻碍学习。我们引入层次化教学监督 (HPO),一种适用于教育评估的结构化对抗性合成框架。与常规的协作型多智能体系统向浅层共识漂移不同,HPO 执行教育评估的 dialectical 分离关注点:专家智能体首先提炼对话背景,然后将其作为 moderated 五幕辩论的依据,在此基础上,反对方教学批评者展开论辩。我们在包含 1,214 场中学生数学对话的 MRBench 数据集上评估了该框架。8B 参数模型实现了 0.845 的 Macro F1,凌驾于 GPT-4o (0.812) 的 3.3%,同时使用参数数仅为其 20 倍。这些结果确立了对抗推理作为在资源受限环境中部署可靠、低计算教学监督的关键机制。

关键词

引用

@article{arxiv.2512.22496,
  title  = {Hierarchical Pedagogical Oversight: A Multi-Agent Adversarial Framework for Reliable AI Tutoring},
  author = {Saisab Sadhu and Ashim Dhor},
  journal= {arXiv preprint arXiv:2512.22496},
  year   = {2025}
}

备注

Accepted for presentation at the AAAI 2026 EGSAI Community Activity (AAAI 2026)