中文

语言模型作为科学辅导教师

计算与语言 2024-07-23 v2

摘要

NLP近期在训练具有强大科学问题解决技能的语言模型方面取得了令人振奋的进展。然而,模型开发并未聚焦于LM在科学领域的实际应用场景,包括需要处理长篇科学文档的教育应用。为了解决这一问题,我们引入了TutorEval和TutorChat。TutorEval是一个多样化的问答基准测试,由专家编写的关于STEM教科书长章节的问题组成。TutorEval有助于衡量LM作为科学助手的实际可用性,并且是首个结合了长上下文、自由形式生成和多学科科学知识的基准测试。此外,我们表明,使用现有对话数据集微调基础模型会在TutorEval上导致较差的性能。因此,我们创建了TutorChat,一个包含80,000个关于教科书的长篇合成对话的数据集。我们使用TutorChat微调了具有7B和34B参数的Llemma模型。这些专攻数学的LM辅导教师具有32K token的上下文窗口,它们在TutorEval上表现出色,同时在GSM8K和MATH上也表现强劲。我们的数据集基于开源材料构建,我们发布了我们的模型、数据和评估。

关键词

引用

@article{arxiv.2402.11111,
  title  = {Language Models as Science Tutors},
  author = {Alexis Chevalier and Jiayi Geng and Alexander Wettig and Howard Chen and Sebastian Mizera and Toni Annala and Max Jameson Aragon and Arturo Rodríguez Fanlo and Simon Frieder and Simon Machado and Akshara Prabhakar and Ellie Thieu and Jiachen T. Wang and Zirui Wang and Xindi Wu and Mengzhou Xia and Wenhan Xia and Jiatong Yu and Jun-Jie Zhu and Zhiyong Jason Ren and Sanjeev Arora and Danqi Chen},
  journal= {arXiv preprint arXiv:2402.11111},
  year   = {2024}
}

备注

8 pages without bibliography and appendix, 26 pages total