中文

规模化对话教育:多 LLM 智能体工作流程用于程序学习与教学质量评估

人工智能 2025-09-08 v2 计算与语言

摘要

大型语言模型 (LLM) 的发展推动了虚拟教师和学习者的发展,连接了自然语言处理与 AI4Education。现有工作往往缺乏可扩展性,且未能充分利用大规模课程内容,对于评估教学质量的框架有限。为此,我们提出 WikiHowAgent,一个利用 LLM 来模拟交互式教学-学习对话的多智能体工作流程。它集成了教师智能体、学习者智能体、交互管理器以及评估器,以促进程序学习并评估教学质量。我们引入了一个包含 114,296 组教师-学习者对话的数据集,这些对话基于 14,287 项教程,涵盖 17 个领域和 727 个主题。我们的评估协议结合了计算指标和基于评分表的指标与人类判断的对齐。结果表明,该工作流程在多种设置下都有效,提供了关于 LLM 在不同领域能力的见解。我们的数据集和实现全部开源。

关键词

引用

@article{arxiv.2507.05528,
  title  = {Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment},
  author = {Jiahuan Pei and Fanghua Ye and Xin Sun and Wentao Deng and Koen Hindriks and Junxiao Wang},
  journal= {arXiv preprint arXiv:2507.05528},
  year   = {2025}
}

备注

14 pages, accepted by EMNLP 2025