EduPersona:面向虚拟学生代理主观能力边界的数据集基准
计算机视觉与模式识别
2025-10-07 v1 计算机与社会
摘要
随着大型语言模型在教育领域的日益集成,面向课堂模拟和教师培训的虚拟学生代理日益重要。然而,这些代理的课堂导向主观能力仍大体未被评估,这限制了对模型边界的理解,并阻碍了可靠部署。我们提出 EduPersona,一个跨越两种语言、三个学科和十种人格类型的大规模基准数据集。该数据集包含 1,308 轮真实课堂对话,涉及 12,814 轮教师-学生问答,并通过人格化扩展为约 10 倍规模(12.8 万轮),为评估提供了坚实基础。基于这一资源,我们将难以量化的主观性能分解为三个递进任务:TASK1 基本连贯性(行为、情感、表达和语音是否与课堂情境一致)、TASK2 学生真实性、TASK3 长期人格一致性,从而建立一个基于教育理论和研究价值的评估框架。我们对三个具有代表性的大型语言模型进行了系统实验,比较其原始版本与十个在 EduPersona 上进行人格微调的变体。结果显示在所有任务中均实现了一致且显著的平均改进:TASK1 提升 33.6%,TASK2 提升 30.6%,TASK3 提升 14.9%。这些改进凸显了数据集的有效性和研究价值,同时也揭示了人格建模的异构难度。总之,EduPersona 提供了首个聚焦于主观能力的课堂基准,建立了解耦且可验证的研究范式,我们将开源数据集和框架以支持更广泛的研究社区在可信且贴近人类的教育 AI 方面取得进展。
关键词
引用
@article{arxiv.2510.04648,
title = {EduPersona: Benchmarking Subjective Ability Boundaries of Virtual Student Agents},
author = {Buyuan Zhu and Shiyu Hu and Yiping Ma and Yuanming Zhang and Kang Hao Cheong},
journal= {arXiv preprint arXiv:2510.04648},
year = {2025}
}
备注
Preprint, Under review