在导师公平性培训的开放性回答评估中比较GPT-4 LLM的少样本提示与BERT分类器
人机交互
2025-01-14 v1
摘要
在基于情境的人类导师培训等定义不明确的领域中评估学习者,是一个研究有限的领域。公平性培训需要对情境有细致入微的理解,但当代大型语言模型(LLM)是否具备能够驾驭这些细微差别的知识库?相比之下,像BERT这样的传统Transformer模型虽然现实世界知识较少,但比商业LLM更容易进行微调。在此,我们研究基于人工标注微调的BERT是否优于采用少样本提示和指令的最先进LLM(GPT-4o和GPT-4-Turbo)。我们在四个预测任务上评估性能,这些任务涉及在高等教育学生群体(学习成为中学导师)中以倡导为核心的培训课程中生成和解释开放性回答。利用包含243条来自导师培训课程的人工标注开放性回答的数据集,我们发现BERT采用离线微调方法表现出更优的性能,且比商业GPT模型更具资源效率。我们得出结论,当代GPT模型可能无法充分捕捉细致入微的回答模式,尤其是在需要解释的复杂任务中。这项工作在微调与少样本提示的视角下,推进了对公平性培训这一细致任务中AI驱动学习者评估的理解,有助于开发更有效的培训解决方案,并协助从业者选择合适的评估方法。
引用
@article{arxiv.2501.06658,
title = {Comparing Few-Shot Prompting of GPT-4 LLMs with BERT Classifiers for Open-Response Assessment in Tutor Equity Training},
author = {Sanjit Kakarla and Conrad Borchers and Danielle Thomas and Shambhavi Bhushan and Kenneth R. Koedinger},
journal= {arXiv preprint arXiv:2501.06658},
year = {2025}
}
备注
8 Page Workshop Paper, AAAI2025 Workshop on Innovation and Responsibility in AI-Supported Education (iRAISE) - Open-response Grading, Feedback, Equity Training, LLMs, BERT, GPT-4