TutorGym:一个用于评估AI智能体作为导师和学生的测试平台
人工智能
2025-05-06 v1
摘要
大型语言模型(LLM)在MATH和GSM8K等学术基准测试中性能的最新提升,使其被大胆地用作独立导师和人类学习的模拟。然而,这些新应用需要的不仅仅是最终解决方案生成的评估。我们引入TutorGym来更直接地评估这些应用。TutorGym是一个标准接口,用于在已在课堂研究中经过测试和完善的现有智能教学系统(ITS)内测试人工智能(AI)智能体,这些系统包括认知导师(CTAT)、学徒导师和OATutors。TutorGym不仅仅是一个简单的问题-解决方案基准,它将AI智能体置于现有ITS的交互界面中。在问题解决的每一步,AI智能体都会被问及作为导师或学习者会做什么。作为导师,AI智能体被提示提供教学支持——例如生成示例、提示和步骤级正确性反馈——这些可以直接与现有ITS提供的自适应逐步支持进行评估。作为学生,智能体直接从ITS教学中学习,其错误和学习轨迹可以与学生的数据进行比较。TutorGym建立了一个通用框架,用于在日益增长的学习环境套件中训练和评估多样化的AI智能体,包括LLM、学习的计算模型和强化学习智能体。目前,TutorGym包含223个不同的导师领域。在初步评估中,我们发现当前的LLM在教学方面表现不佳——在标记错误操作方面,没有一个比随机猜测做得更好,下一步操作的正确率仅为约52-70%——但当它们作为学生通过上下文学习进行训练时,可以产生非常类似人类的学习曲线。
引用
@article{arxiv.2505.01563,
title = {TutorGym: A Testbed for Evaluating AI Agents as Tutors and Students},
author = {Daniel Weitekamp and Momin N. Siddiqui and Christopher J. MacLellan},
journal= {arXiv preprint arXiv:2505.01563},
year = {2025}
}