当语言问题至关重要:一种重新审视的敏感内容标注方法
计算与语言
2023-11-20 v1
摘要
许多资源匮乏的语言需要用于特定任务的高质量数据集,例如攻击性语言检测、虚假信息或错误信息识别。然而,内容的复杂性可能对标注者产生不利影响。本文旨在以涵盖俄乌克兰战争的乌克兰语推文为例,重新审视一种对敏感数据进行伪标注的方法。当前,这一尖锐话题处于各种语言操纵的焦点之下,在社交媒体平台上引发大量虚假信息与污言秽语。所开展的实验突出了数据标注的三个主要阶段,并指出了机器标注过程中的主要障碍。最终,我们对所获数据提供了基础性统计分析、对用于伪标注的模型进行了评估,并给出了科学家如何在不涉及标注者参与的情况下利用该语料开展更深入研究及扩展现有数据样本的进一步指导方针。
引用
@article{arxiv.2311.10514,
title = {When a Language Question Is at Stake. A Revisited Approach to Label Sensitive Content},
author = {Stetsenko Daria},
journal= {arXiv preprint arXiv:2311.10514},
year = {2023}
}
备注
Ukrainian language, pseudo-labelling, dataset, offensive-language