中文

先进 LLM 技术对机器人课程 AI 讲座教师影响的评估

计算与语言 2024-08-12 v1 人工智能 计算机与社会 机器人学

摘要

本研究评估了大型语言模型(LLM)作为人工智能课程教师的性能。具体而言,采用了包括提示工程、检索增强生成(RAG)和微调等多种先进技术。我们使用常用的相似性指标,如 BLEU-4、ROUGE 和 BERTScore,对不同模型和应用技术进行评估,并辅以小规模的人类帮助性和可信度评估。我们的发现表明,RAG 结合提示工程显著提升了模型响应,产生更准确的事实性答案。在教育领域,RAG 似乎是一种理想技术,因为其基于通过补充额外信息和材料来丰富模型输入,而这些信息通常已存在于大学课程中。相比之下,微调可以制造出小规模且仍具专业能力的模型,但存在过拟合的风险。本研究进一步探讨了如何衡量 LLM 的性能,以及当前评估方法是否能代表其正确性或相关性。我们发现,相似性指标之间高度相关,且大多数指标倾向于更短的回答。总体而言,本研究指出了将 LLM 集成到教育场景中的潜力与挑战,建议采用平衡的训练方法和更先进的评估框架。

关键词

引用

@article{arxiv.2408.04645,
  title  = {Evaluating the Impact of Advanced LLM Techniques on AI-Lecture Tutors for a Robotics Course},
  author = {Sebastian Kahl and Felix Löffler and Martin Maciol and Fabian Ridder and Marius Schmitz and Jennifer Spanagel and Jens Wienkamp and Christopher Burgahn and Malte Schilling},
  journal= {arXiv preprint arXiv:2408.04645},
  year   = {2024}
}

备注

The article is an extended version of a paper presented at the International Workshop on AI in Education and Educational Research (AIEER) at ECAI-2024 (27th European Conference on Artificial Intelligence)