自诊断与自去偏:一种减少 NLP 中基于语料偏差的提议
计算与语言
2021-09-10 v2
摘要
当在互联网上大规模未过滤的爬取语料上训练时,语言模型会习得并复现数据中存在的各类不良偏差:它们常生成种族主义、性别歧视、暴力或其他有毒语言。由于大型模型需要数百万训练样本以获得良好性能,难以完全阻止其接触此类内容。本文中,我们首先展示一个令人惊讶的发现:预训练语言模型在相当程度上能识别自身不良偏差及其生成内容的有毒性。我们将此能力称为自诊断。基于该发现,我们进而提出一种解码算法,其仅给定不良行为的文本描述,便可降低语言模型生成问题文本的概率。我们将此方法称为自去偏。自去偏不依赖人工整理的词汇表,也不需要任何训练数据或模型参数改动。尽管我们远未消除语言模型生成偏差文本的问题,但相信我们的方法是朝此方向的重要一步。
引用
@article{arxiv.2103.00453,
title = {Self-Diagnosis and Self-Debiasing: A Proposal for Reducing Corpus-Based Bias in NLP},
author = {Timo Schick and Sahana Udupa and Hinrich Schütze},
journal= {arXiv preprint arXiv:2103.00453},
year = {2021}
}
备注
Accepted at TACL