评估大语言模型生成准确教师回复的有效性
计算与语言
2023-11-14 v1 机器学习
摘要
(Tack et al., 2023)组织了第18届自然语言处理构建教育应用创新使用研讨会中关于教育对话中教师语言生成的共享任务。遵循该共享任务的结构,在本研究中,我们尝试评估大语言模型在向学生提供信息丰富且有帮助的见解从而模拟知识型教师角色方面的生成能力。为此,我们对若干基准生成模型进行了广泛评估,包括GPT-4(少样本、上下文学习)、微调GPT-2和微调DialoGPT。此外,为优化教学品质,我们使用强化学习微调了Flan-T5模型。我们在Teacher-Student Chatroom Corpus子集上的实验结果表明,以BERTScore和DialogRPT衡量,GPT-4优于其它微调模型。我们假设若干数据集特征,包括采样、代表性和对话完整性,对微调提出了重大挑战,从而导致微调模型的泛化能力较差。最后,我们注意到需要以不仅依赖对话连贯性和匹配的语言建模分布,而且依赖模型展示教学技能能力的指标来评估这些生成模型。
引用
@article{arxiv.2307.04274,
title = {Assessing the efficacy of large language models in generating accurate teacher responses},
author = {Yann Hicke and Abhishek Masand and Wentao Guo and Tushaar Gangavarapu},
journal= {arXiv preprint arXiv:2307.04274},
year = {2023}
}