中文

教育中的大语言模型:ChemTAsk —— 面向研究生课堂的开源自动 Q&A 范式

计算机与社会 2025-02-10 v2 人机交互

摘要

大语言模型(LLM)在研究生教育中显示出广泛潜力,但受限于训练数据和潜在的幻觉现象。我们开发了 ChemTAsk,一种开源管道,将 LLM 与检索增强生成(RAG)相结合,提供准确、具体语境下的帮助。ChemTAsk 利用课程材料,包括讲座录音和原始出版物,来生成准确的学生查询响应。在匹兹堡大学的一个高级生物化学课程中持续九周,学生可选择使用 ChemTAsk 来获取作业帮助或理解课堂内容。对比分析显示,ChemTAsk 在理解学生查询和提供准确信息方面,与人类助教(TA)相当,尤其在创造性问题解决任务中表现突出。相比之下,TA 在响应准确性和针对课堂具体细节的定制化方面更为精确。学生反馈表明,ChemTAsk 被认为比 TA 更正确、更有帮助、更快捷。我们测试了来自 Meta 和 OpenAI 的开源和专有模型,在原始生物化学基准测试上进行了评估,以便未来迭代改进 ChemTAsk。结果发现,OpenAI 模型对输入提示的偏差更宽容,并在自我评估方面表现突出,以保护潜在的幻觉现象。综上所述,ChemTAsk 展示了将 LLM 与 RAG 集成以增强教育支持的潜力,为学生和教育者提供了一个可扩展的工具。

关键词

引用

@article{arxiv.2502.00016,
  title  = {Large Language Models for Education: ChemTAsk -- An Open-Source Paradigm for Automated Q&A in the Graduate Classroom},
  author = {Ryann M. Perez and Marie Shimogawa and Yanan Chang and Hoang Anh T. Phan and Jason G. Marmorstein and Evan S. K. Yanagawa and E. James Petersson},
  journal= {arXiv preprint arXiv:2502.00016},
  year   = {2025}
}

备注

38 pages, 3 figures, 1 table