中文

RedditBias:用于对话语言模型偏差评估与去偏的真实世界资源

计算与语言 2021-06-08 v1

摘要

文本表示模型易于表现出一系列社会偏见,反映出底层预训练数据不受控制且带有偏差的本质,进而引发严重的伦理问题甚至偏差放大。近期工作主要聚焦于衡量与缓解预训练语言模型中的偏差。令人惊讶的是,面向对话语言模型的偏差度量与缓解资源及方法的图景仍极为匮乏:其仅限于极少数偏差类型、人工构建的资源,且完全忽略了去偏方法可能对对话任务(如对话响应生成)最终性能的影响。本工作中,我们提出 RedditBias,首个基于 Reddit 真实人类对话的对话数据集,支持跨四种重要偏差维度——性别、种族、宗教与酷儿身份——进行偏差度量与缓解。进一步,我们开发了一个评估框架,可同时 1)在所构建的 RedditBias 资源上度量偏差,以及 2)在模型去偏后评估其在对话任务上的能力。我们利用该评估框架对广泛使用的对话 DialoGPT 模型及四种去偏方法的适配版进行基准测试。我们的结果表明,DialoGPT 对宗教群体存在偏见,且某些去偏技术可在保持下游任务性能的同时消除该偏见。

关键词

引用

@article{arxiv.2106.03521,
  title  = {RedditBias: A Real-World Resource for Bias Evaluation and Debiasing of Conversational Language Models},
  author = {Soumya Barikeri and Anne Lauscher and Ivan Vulić and Goran Glavaš},
  journal= {arXiv preprint arXiv:2106.03521},
  year   = {2021}
}

备注

Accepted for ACL21