分析用于课堂讨论评估的大型语言模型
计算与语言
2024-06-14 v1
摘要
借助大型语言模型(LLM)等自然语言处理新进展,自动评估课堂讨论质量正变得越来越可行。在这项工作中,我们研究了2个LLM的评估性能如何与可能影响性能的3个因素(任务表述、上下文长度和少样本示例)相互作用。我们还探讨了这2个LLM的计算效率和预测一致性。我们的结果表明,上述3个因素确实会影响所测试LLM的性能,并且一致性与性能之间存在关系。我们推荐一种基于LLM的评估方法,该方法在预测性能、计算效率和一致性方面具有良好的平衡。
引用
@article{arxiv.2406.08680,
title = {Analyzing Large Language Models for Classroom Discussion Assessment},
author = {Nhat Tran and Benjamin Pierce and Diane Litman and Richard Correnti and Lindsay Clare Matsumura},
journal= {arXiv preprint arXiv:2406.08680},
year = {2024}
}
备注
EDM 2024 Short Paper