在数据收集中引入语言学家是否能改进 NLU 数据收集?
计算与语言
2021-04-16 v1
摘要
许多众包 NLP 数据集含有系统性缺口与偏差,这些往往在数据收集完成后才被识别。在众包过程中从早期数据样本中识别这些问题应能使缓解更高效,尤其当以迭代方式进行时。我们以自然语言推理为测试用例,探究在数据收集时让语言学家“介入循环”以通过引入任务新约束来动态识别并解决数据缺口是否有益。我们直接比较三种数据收集协议:(i)基线协议,(ii)具有迭代更新任务约束的语言学家介入干预,以及(iii)语言学家介入的扩展版,其通过聊天室提供语言学家与众包工人的直接交互。含语言学家参与所收集的数据集比基线更可靠地具有挑战性,且不损失质量。但我们未见证据表明在训练中使用这些数据能带来更好的域外模型表现,且添加聊天平台对所得数据集无 measurable 影响。我们建议在数据收集“期间”整合专家分析,以便专家能动态解决数据集中的缺口与偏差。
引用
@article{arxiv.2104.07179,
title = {Does Putting a Linguist in the Loop Improve NLU Data Collection?},
author = {Alicia Parrish and William Huang and Omar Agha and Soo-Hwan Lee and Nikita Nangia and Alex Warstadt and Karmanya Aggarwal and Emily Allaway and Tal Linzen and Samuel R. Bowman},
journal= {arXiv preprint arXiv:2104.07179},
year = {2021}
}
备注
14 pages, 10 figures