面向自动化定性分析:利用大语言模型进行辅导对话评估
人机交互
2025-04-22 v1 计算与语言
摘要
本研究引入了一种利用大语言模型(LLM)的自动化系统,用于评估五种关键辅导策略的有效性:1. 提供有效赞美,2. 对错误作出反应,3. 确定学生已知内容,4. 帮助学生管理不平等情况,5. 应对自我否定言论。使用来自 Teacher-Student Chatroom Corpus 的公开数据集,我们的系统将每种辅导策略分类为“被正确采用”或“被错误采用”。本研究采用 GPT-3.5 进行 few-shot 提示,以评估这些策略的使用情况并分析辅导对话。结果显示,对于这五种辅导策略,真阴性率(TNR)范围为 0.655 至 0.738,召回率(Recall)范围为 0.327 至 0.432,表明该模型在排除错误分类方面效果较好,但在持续识别正确策略方面存在挑战。策略 "帮助学生管理不平等情况" 表现最佳,TNR 为 0.738,召回率为 0.432。该研究凸显了 LLM 在辅导策略分析中的潜力,并为未来的改进提出了方向,包括整合更先进的模型以实现更细致的反馈。
引用
@article{arxiv.2504.13882,
title = {Toward Automated Qualitative Analysis: Leveraging Large Language Models for Tutoring Dialogue Evaluation},
author = {Megan Gu and Chloe Qianhui Zhao and Claire Liu and Nikhil Patel and Jahnvi Shah and Jionghao Lin and Kenneth R. Koedinger},
journal= {arXiv preprint arXiv:2504.13882},
year = {2025}
}
备注
Manuscript accepted to the Workshop on "From Data to Discovery: LLMs for Qualitative Analysis in Education" at LAK25