DataEnvGym:基于学生反馈的教师环境数据生成代理
计算与语言
2025-03-14 v3 人工智能
机器学习
摘要
当前创建训练数据以教导模型的过程由人类完成,人类需手动分析模型薄弱环节并规划如何创建数据以改进学生模型。使用 LLM 作为标注者可减少人类工作,但仍需要人类解读评估反馈并控制 LLM 生成学生所需的数据。自动化这一耗时的过程,即通过创建自主数据生成代理(即教师)以实现数据创建的闭环反馈循环,是理想的做法,但需要能够模拟此类反馈驱动的迭代过程的环境。为实现此类代理及其模块的快速可扩展测试,我们引入DataEnvGym——一组用于数据生成代理的教师环境测试平台。DataEnvGym 将数据生成建模为序列决策任务,代理由数据生成策略(用于生成创建训练数据的计划)和数据生成引擎(将计划转化为数据)组成,置于提供学生反馈的环境中。代理目标是提高学生性能。学生在生成数据上进行迭代训练和评估,其反馈(以错误或薄弱技能形式)在每次迭代后报告给代理。DataEnvGym 包含3个层次结构状态表示和动作空间的教师环境实例。更结构化的环境基于推断技能,提供更大的可解释性和课程控制。我们支持4个领域(数学、代码、VQA 和工具使用),并测试了多个学生和教师。我们的教学环境中的示例代理可在不同任务和设置下迭代改进学生。此外,我们表明环境在不同技能水平和关键模块变体方面具有差异,指向改进数据生成代理、引擎和反馈机制的未来工作方向。
引用
@article{arxiv.2410.06215,
title = {DataEnvGym: Data Generation Agents in Teacher Environments with Student Feedback},
author = {Zaid Khan and Elias Stengel-Eskin and Jaemin Cho and Mohit Bansal},
journal= {arXiv preprint arXiv:2410.06215},
year = {2025}
}
备注
ICLR 2025 Spotlight; Project Page: https://DataEnvGym.github.io