因果 ATE 缓解受控文本生成中的非预期偏置
计算与语言
2024-02-19 v2
摘要
我们通过因果平均处理效应(Causal Average Treatment Effect, Causal ATE)方法研究语言模型中的属性控制。语言模型(LM)中属性控制任务的现有方法检查句子中词语与感兴趣属性的共现,并对其进行控制。然而,训练数据集中词语与属性的伪相关,会导致模型在推理时遇到该伪相关词时幻觉出属性的存在。我们展示简单的基于扰动的 Causal ATE 方法可消除此非预期效应。具体而言,我们将其立足于毒性缓解问题,其中一项重大挑战在于解毒后往往对受保护群体出现非预期偏置。我们展示该非预期偏置可通过使用 Causal ATE 度量解决,并严格证明我们的论断。我们为论断提供实验验证,并匿名发布代码:https://github.com/causalate-mitigates-bias/causal-ate-mitigates-bias。
引用
@article{arxiv.2311.11229,
title = {Causal ATE Mitigates Unintended Bias in Controlled Text Generation},
author = {Rahul Madhavan and Kahini Wadhawan},
journal= {arXiv preprint arXiv:2311.11229},
year = {2024}
}
备注
12 pages, 5 figures