中文

主动学习引导问答难度估计的标注工作

机器学习 2024-10-11 v2 计算机与社会 机器学习

摘要

近年来,随着自然语言处理技术的发展,针对问答难度估计(QDE)的研究呈上升趋势。基于Transformer的神经网络实现了该任务的最新性能,主要通过监督方法达成,但仅有少量针对无监督学习的研究。虽然监督方法关注预测性能,但需要大量标注数据;而无监督方法则不需要标注数据,但依赖另一种在实践中计算成本高昂的评估指标。本文通过探索主动学习用于QDE,弥合了此研究空白,提出一种监督式人类在环方法,旨在最小化标注工作,同时保持与最新模型相当的性能。该工作流程迭代训练于标注子集,仅为最具信息性的未标注数据点从人类专家处获取标签。此外,我们提出一种新型获取函数PowerVariance,用于将最具信息性的样本加入标注集合,是流行于分类任务中的PowerBALD函数的回归扩展。我们采用DistilBERT进行QDE,并通过对 dropout进行蒙特卡洛抽样以捕获未标注样本中的认识不确定性。实验表明,采用PowerVariance获取的主动学习在仅标注训练数据的10%情况下,即可达到接近全监督模型的性能。该方法促进了教育资源的负责任使用,使QDE工具更易于课程教师采纳,亦可用于个性化支持系统和问答系统等其他应用。

关键词

引用

@article{arxiv.2409.09258,
  title  = {Active Learning to Guide Labeling Efforts for Question Difficulty Estimation},
  author = {Arthur Thuy and Ekaterina Loginova and Dries F. Benoit},
  journal= {arXiv preprint arXiv:2409.09258},
  year   = {2024}
}

备注

Published as a workshop paper at ECML-PKDD 2024