分析自监督在处理语言偏见中的局限性
计算与语言
2023-08-17 v3 人工智能
摘要
用自然语言任务描述提示输入已成为一种流行机制,能以极少甚至无上下文监督从大规模生成式语言模型中引出相当准确的输出。这也有助于洞察语言模型仅通过在大规模无标注文本语料上的自监督预训练,能在多大程度上捕获广泛下游任务的语义。此类模型自然也暴露了大量不良内容(如种族主义与性别歧视语言),而关于模型在这些维度上觉察能力的研究有限。本文中,我们定义并全面评估此类语言模型在四类偏见任务上的语义捕获能力:诊断、识别、抽取与改写。我们为这些任务定义了三类宽泛的任务描述:陈述、提问与补全,每类内含多种词汇变体。我们研究了使用这些类别及空任务描述,在多种解码方法与少样本示例下提示各任务的效力。我们的分析表明,语言模型在不同偏见维度(如性别与政治归属)上执行这些任务的能力差异显著。我们认为,通过量化当前自监督目标在完成此类社会学挑战性任务上的局限,我们的工作是迈向无偏见语言模型的重要一步。
引用
@article{arxiv.2112.08637,
title = {Analyzing the Limits of Self-Supervision in Handling Bias in Language},
author = {Lisa Bauer and Karthik Gopalakrishnan and Spandana Gella and Yang Liu and Mohit Bansal and Dilek Hakkani-Tur},
journal= {arXiv preprint arXiv:2112.08637},
year = {2023}
}
备注
Accepted at Findings of the Conference on Empirical Methods in Natural Language Processing (EMNLP) 2022