中文

自然语言处理模型中的预测偏差:概念框架与综述

计算与语言 2020-09-15 v2 人工智能 机器学习

摘要

自然语言处理中越来越多的工作探讨了偏差对预测结果的影响,并引入了作用于标准 NLP 流程不同环节(数据与模型)的缓解技术。然而,这些工作彼此孤立,缺乏统一框架来组织该领域的努力。这导致了重复性的方法,并将不当的关注点置于偏差的影响而非其根源。聚焦于偏差症状而非潜在根源的研究,可能限制有效对策的发展。本文中,我们提出一个统一的概念化框架:NLP 的预测偏差框架。我们总结了 NLP 文献,给出了 NLP 中预测偏差的一般数学定义及概念框架,区分了四类主要偏差根源:标签偏差、选择偏差、模型过度放大以及语义偏差。我们讨论了过往工作如何对抗每一类偏差根源。我们的框架旨在引导对 NLP 中预测偏差的入门综述,将现有工作整合进单一结构,并为未来研究开辟途径。

关键词

引用

@article{arxiv.1912.11078,
  title  = {Predictive Biases in Natural Language Processing Models: A Conceptual Framework and Overview},
  author = {Deven Shah and H. Andrew Schwartz and Dirk Hovy},
  journal= {arXiv preprint arXiv:1912.11078},
  year   = {2020}
}

备注

9 pages excluding references, 1 figure, 3 pages for appendix