自然语言处理模型中的预测偏差:概念框架与综述
计算与语言
2020-09-15 v2 人工智能
机器学习
摘要
自然语言处理中越来越多的工作探讨了偏差对预测结果的影响,并引入了作用于标准 NLP 流程不同环节(数据与模型)的缓解技术。然而,这些工作彼此孤立,缺乏统一框架来组织该领域的努力。这导致了重复性的方法,并将不当的关注点置于偏差的影响而非其根源。聚焦于偏差症状而非潜在根源的研究,可能限制有效对策的发展。本文中,我们提出一个统一的概念化框架:NLP 的预测偏差框架。我们总结了 NLP 文献,给出了 NLP 中预测偏差的一般数学定义及概念框架,区分了四类主要偏差根源:标签偏差、选择偏差、模型过度放大以及语义偏差。我们讨论了过往工作如何对抗每一类偏差根源。我们的框架旨在引导对 NLP 中预测偏差的入门综述,将现有工作整合进单一结构,并为未来研究开辟途径。
引用
@article{arxiv.1912.11078,
title = {Predictive Biases in Natural Language Processing Models: A Conceptual Framework and Overview},
author = {Deven Shah and H. Andrew Schwartz and Dirk Hovy},
journal= {arXiv preprint arXiv:1912.11078},
year = {2020}
}
备注
9 pages excluding references, 1 figure, 3 pages for appendix