从神经表征中擦除未对齐属性
计算与语言
2023-04-19 v2
摘要
我们提出赋值最大化谱属性去除(AMSAL)算法,当待擦除信息为隐式而非与每个输入样本直接对齐时,该算法可从神经表征中擦除信息。我们的算法通过交替执行两步来工作:一步为输入表征到待擦除信息的赋值,另一步将输入表征与待擦除信息投影至联合潜空间。我们在大量数据集上测试了算法,包括具有多个受保护属性的 Twitter 数据集、BiasBios 数据集及 BiasBench 基准。最后一基准包含四个具各类受保护属性的数据集。结果表明,在我们的设定下偏置常可被去除。我们也讨论了当主任务与待擦除信息强纠缠时本方法的局限性。
引用
@article{arxiv.2302.02997,
title = {Erasure of Unaligned Attributes from Neural Representations},
author = {Shun Shao and Yftah Ziser and Shay Cohen},
journal= {arXiv preprint arXiv:2302.02997},
year = {2023}
}
备注
Accepted to Transactions of the Association for Computational Linguistics, 22 pages (pre-MIT Press publication version)