中文

去偏应兼具好与坏:度量语言模型中去偏技术的一致性

计算与语言 2023-05-24 v1 人工智能

摘要

旨在缓解语言模型(LMs)偶尔输出有毒或不恰当文本倾向的去偏方法近来受到关注。本文中,我们提出一种标准化协议,用以区分不仅产生可取结果、且与其机制与设定一致的方法。例如,我们追问:给定一个为降低 LMs 中毒性而开发的去偏方法,若其所用的毒性定义被反转,去偏结果是否也会反转?我们借助此类考量为协议设计三项准则:设定极性、设定重要性与域可迁移性。作为案例研究,我们将协议应用于一种流行的去偏方法 Self-Debiasing,并与我们提出的 Instructive Debiasing 比较,表明一致性之于去偏可行性如同单纯的可取结果一样重要。我们展示该协议提供了对去偏方法泛化性与可解释性的关键洞见,否则这些可能被忽视。

关键词

引用

@article{arxiv.2305.14307,
  title  = {Debiasing should be Good and Bad: Measuring the Consistency of Debiasing Techniques in Language Models},
  author = {Robert Morabito and Jad Kabbara and Ali Emami},
  journal= {arXiv preprint arXiv:2305.14307},
  year   = {2023}
}

备注

9 pages (excluding references), accepted at ACL Findings 2023