噪声审计改进道德基础分类
计算与语言
2022-10-17 v1 计算机与社会
摘要
道德在文化、身份与情感中扮演重要角色。自然语言处理近期的进展表明,大规模对文本中表达的道德价值进行分类是可行的。道德分类依赖人类标注者为文本中的道德表达打标签,从而提供训练数据以实现最先进的性能。然而,这些标注 inherently 主观,且部分样本难以分类,因错误或缺乏一致性而导致噪声标注。训练数据中噪声的存在损害了分类器从文本中准确识别道德基础的能力。我们提出两种度量以审计标注的噪声。第一种度量是样本标签的熵,作为标注者对该样本应如何标注之分歧的代理测度。第二种度量是标注者赋予样本之标签的轮廓系数。该度量利用同标签样本应具有相似潜表示的想法,而对集体判断的偏离则指示错误。我们在三个广泛使用的道德基础数据集上的实验表明,基于所提度量移除噪声标注可提升分类性能。
引用
@article{arxiv.2210.07415,
title = {Noise Audits Improve Moral Foundation Classification},
author = {Negar Mokhberian and Frederic R. Hopp and Bahareh Harandizadeh and Fred Morstatter and Kristina Lerman},
journal= {arXiv preprint arXiv:2210.07415},
year = {2022}
}