中文

通过反事实评估降低语言模型中的情感偏差

计算与语言 2020-10-09 v3 计算机与社会 机器学习

摘要

语言建模架构的进步与大型文本语料的可获得性推动了自动文本生成的进展。虽然这造就了能够生成连贯文本的模型,但也促使模型内化了训练语料中存在的社交偏差。本文旨在量化并降低语言模型表现出的一种特定偏差:生成文本情感中的偏差。给定条件上下文(如写作提示)与语言模型,我们采用一种反事实评估来分析(以及怎样)生成文本的情感是否受到条件上下文中敏感属性(如国家名称、职业、性别)取值变化的影响。我们通过采用公平机器学习文献中的个体与群体公平性度量来量化情感偏差,并证明在两个不同语料(新闻文章与 Wikipedia)上训练的大规模模型表现出相当程度的偏差。随后我们提出对语言模型隐表示的嵌入与情感预测派生正则化。这些正则化在保持可比的困惑度与语义相似度水平的同时改善了公平性度量。

关键词

引用

@article{arxiv.1911.03064,
  title  = {Reducing Sentiment Bias in Language Models via Counterfactual Evaluation},
  author = {Po-Sen Huang and Huan Zhang and Ray Jiang and Robert Stanforth and Johannes Welbl and Jack Rae and Vishal Maini and Dani Yogatama and Pushmeet Kohli},
  journal= {arXiv preprint arXiv:1911.03064},
  year   = {2020}
}

备注

Accepted in the Findings of EMNLP, 2020