从幻灯片到聊天机器人:通过大学课程材料提升大语言模型性能
计算与语言
2026-03-19 v2
摘要
大语言模型(LLMs)在近年来取得了快速进展。其中一种应用是支持学生在教育环境中的学习。然而,先前的工作表明,LLMs在大学水平的计算机科学课程中仍然难以准确回答问题。本文探讨了如何通过纳入大学课程材料来增强LLMs在此场景中的性能。一个关键挑战在于利用多样化的课程材料,如讲义和录音稿,这些材料与典型文本语料库截然不同:讲义还包含图像和公式等视觉元素,而录音稿包含口语化、较不结构化的语言。我们比较了两种策略:检索增强生成(RAG)和持续预训练(CPT),以将课程特定知识扩展到LLMs。对于讲义,我们进一步探索了一种多模态RAG方法,即以图像形式呈现检索到的内容。我们的实验表明,鉴于大学课程材料相对较小的大小,RAG在有效性和效率上都优于CPT。此外,在多模态setting中,将讲义作为图像进行检索,显著优于仅使用文本检索。这些发现突显了开发更好支持学习和教学的AI助手的实用策略,并希望能激发其他教育背景下的类似努力。
引用
@article{arxiv.2510.22272,
title = {From Slides to Chatbots: Enhancing Large Language Models with University Course Materials},
author = {Tu Anh Dinh and Philipp Nicolas Schumacher and Jan Niehues},
journal= {arXiv preprint arXiv:2510.22272},
year = {2026}
}
备注
Accepted to NSLP @ LREC 2026