大型语言模型生成情境相关问题的比较研究
计算与语言
2024-09-17 v2 人工智能
计算机与社会
摘要
本研究探讨了大型语言模型(LLM)在教育环境中自动生成问题的有效性。比较了三个LLM在未经微调的情况下,从大学幻灯片文本创建问题的能力。通过两个步骤的管道获取问题:首先,使用Llama 2-Chat 13B从幻灯片中提取答案短语;然后,三个模型为每个答案生成问题。为分析问题是否适合用于学生的教育应用,进行了为46名学生完成的调查,他们评估了246个问题,基于五个指标:清晰度、相关性、难度、幻灯片关联性和问题-答案一致性。结果表明,GPT-3.5和Llama 2-Chat 13B在整体表现上略胜于Flan T5 XXL,尤其是在清晰度和问题-答案一致性方面。GPT-3.5在特别是匹配输入答案方面表现突出。该研究的贡献在于分析大型语言模型在教育中的自动问题生成能力。
引用
@article{arxiv.2407.20578,
title = {Comparison of Large Language Models for Generating Contextually Relevant Questions},
author = {Ivo Lodovico Molina and Valdemar Švábenský and Tsubasa Minematsu and Li Chen and Fumiya Okubo and Atsushi Shimada},
journal= {arXiv preprint arXiv:2407.20578},
year = {2024}
}
备注
Published in Springer ECTEL 2024 conference proceedings, see https://doi.org/10.1007/978-3-031-72312-4_18