IntrEx:一个用于教育对话参与度建模的数据集
计算与语言
2025-09-18 v2
摘要
参与度和动机对于第二语言习得至关重要,然而在教育对话中维持学习者的兴趣仍然是一个挑战。尽管先前的研究探讨了是什么让教育文本有趣,但关于驱动对话参与度的语言特征,我们仍知之甚少。为弥补这一空白,我们引入了 IntrEx,这是第一个针对师生互动中的趣味性和预期趣味性进行标注的大型数据集。IntrEx 建立在师生聊天室语料库(TSCC)之上,通过引入序列级标注扩展了先前的工作,允许研究超越孤立话轮的参与度,以捕捉兴趣在扩展对话中的演变过程。我们采用了一个严格的标注流程,涉及超过100名第二语言学习者,使用一种受人类反馈强化学习(RLHF)启发的基于比较的评分方法来提高一致性。我们研究了大型语言模型(LLM)是否能预测人类的趣味性判断。我们发现,在趣味性评分上微调的 LLM(7B/8B 参数)优于 GPT-4o 等更大的专有模型,展示了专用数据集在教育环境中建模参与度的潜力。最后,我们分析了语言和认知因素,如具体性、可理解性(可读性)和吸收,如何影响教育对话中的参与度。
引用
@article{arxiv.2509.06652,
title = {IntrEx: A Dataset for Modeling Engagement in Educational Conversations},
author = {Xingwei Tan and Mahathi Parvatham and Chiara Gambi and Gabriele Pergola},
journal= {arXiv preprint arXiv:2509.06652},
year = {2025}
}
备注
EMNLP 2025 Findings camera-ready, 9+7 pages