评估大型语言模型用于教师模拟自动分析
人工智能
2024-07-31 v1
摘要
数字模拟(DS)提供了安全的环境,用户通过对话提示与智能体交互,提供富有洞察力的学习体验,可用于训练教师候选人在真实教室情境中的应对能力。这些模拟通常包括开放式问题,允许教师候选人表达思想,但 complicates 自动响应分析。为此,我们评估了大型语言模型(LLMs)以识别 DS 中教师教育响应中所识别特征(用户行为)。我们评估了 DeBERTaV3 和 Llama 3 的性能,分别结合零样本、少样本和微调。我们的实验发现,LLMs 的性能在不同特征识别上存在显著差异。此外,我们注意到 DeBERTaV3 在识别新特征时显著降低了性能。相比之下,Llama 3 在检测新特征方面优于 DeBERTaV3,表现更稳定。因此,在需要教师教育者因模拟或教育目标的变化而引入新特征的 DS 中,更推荐使用 Llama 3。这些结果可指导其他研究人员在 DS 中引入 LLM,以满足对高度需求的自动评估。
引用
@article{arxiv.2407.20360,
title = {Evaluating Large Language Models for automatic analysis of teacher simulations},
author = {David de-Fitero-Dominguez and Mariano Albaladejo-González and Antonio Garcia-Cabot and Eva Garcia-Lopez and Antonio Moreno-Cediel and Erin Barno and Justin Reich},
journal= {arXiv preprint arXiv:2407.20360},
year = {2024}
}