中文

检索内容中的社会偏见:BERT 排序器的度量框架与对抗缓解

信息检索 2021-05-12 v2 人工智能 机器学习

摘要

社会偏见在信息检索(IR)系统的检索内容中产生共鸣,导致既有刻板印象被强化。解决此问题需要建立关于检索结果中各类社会群体表征的公平性度量,以及缓解此类偏见的方法,尤其在深度排序模型取得进展的背景下。本工作中,我们首先提供一种新颖的框架来度量排序模型检索文本内容中的公平性。该框架引入了与排序器无关的度量,还能够将语料库对公平性的影响与排序器的影响解耦。为缓解这些偏见,我们提出 AdvBert,一种通过将对抗偏见缓解适配于 IR 而实现的排序模型,它联合学习预测相关性与去除受保护属性。我们在两个段落检索集合(MSMARCO Passage Re-ranking 和 TREC Deep Learning 2019 Passage Re-ranking)上开展实验,并通过针对性别属性的选定查询子集的公平性标注对集合进行扩展。在 MSMARCO 基准上的结果表明:(1) 所有排序模型相较于与排序器无关的基线均更不公平;(2) 使用所提出的 AdvBert 模型时,Bert 排序器的公平性显著提升。最后,我们考察了公平性与效用的权衡,表明可以在不显著损失效用的情况下保持公平性的显著提升。

关键词

引用

@article{arxiv.2104.13640,
  title  = {Societal Biases in Retrieved Contents: Measurement Framework and Adversarial Mitigation for BERT Rankers},
  author = {Navid Rekabsaz and Simone Kopeinik and Markus Schedl},
  journal= {arXiv preprint arXiv:2104.13640},
  year   = {2021}
}

备注

Accepted at SIGIR 2021