SIGHT:基于高等教育转录文本的学生洞察大型标注数据集
计算与语言
2023-06-16 v1 人工智能
摘要
讲座对学生和教师均为学习体验。学生从教师处学习学科内容,而教师从学生处了解如何改进教学。然而,在线学生反馈是非结构化且海量的,使教师难以学习并改进。我们朝应对此挑战迈出一步。首先,我们贡献一个用于研究该问题的数据集:SIGHT 是一个大型数据集,包含从麻省理工学院开放课程ware(MIT OCW)YouTube 频道收集的 288 份数学讲座转录文本与 15,784 条评论。其次,我们借助定性分析开发了一套反馈类型分类准则。定性分析方法在揭示领域特定洞察上十分有力,但将其应用于大型数据源成本高昂。为克服此挑战,我们提出一套使用大语言模型(LLMs)以低成本大规模分类评论的最佳实践。我们观察到模型与人工标注间存在显著相关性:具有一致人工标注(> 评分者间信度,IRR)的类别也展现出更高的人机一致度(>),而人工标注较不一致(- IRR)的类别相应表现出较低的人机一致度(-)。这些技术从数千条评论中发掘出有益的学生反馈,每条评论成本约 \0.002$。我们最后讨论了利用在线学生反馈及改进定性研究自动化标注技术的令人振奋的未来方向。
引用
@article{arxiv.2306.09343,
title = {SIGHT: A Large Annotated Dataset on Student Insights Gathered from Higher Education Transcripts},
author = {Rose E. Wang and Pawan Wirawarn and Noah Goodman and Dorottya Demszky},
journal= {arXiv preprint arXiv:2306.09343},
year = {2023}
}
备注
First two authors contributed equally. In the Proceedings of Innovative Use of NLP for Building Educational Applications 2023. The code and data are open-sourced here: https://github.com/rosewang2008/sight