中文

从神经表征中擦除未对齐属性

计算与语言 2023-04-19 v2

摘要

我们提出赋值最大化谱属性去除(AMSAL)算法,当待擦除信息为隐式而非与每个输入样本直接对齐时,该算法可从神经表征中擦除信息。我们的算法通过交替执行两步来工作:一步为输入表征到待擦除信息的赋值,另一步将输入表征与待擦除信息投影至联合潜空间。我们在大量数据集上测试了算法,包括具有多个受保护属性的 Twitter 数据集、BiasBios 数据集及 BiasBench 基准。最后一基准包含四个具各类受保护属性的数据集。结果表明,在我们的设定下偏置常可被去除。我们也讨论了当主任务与待擦除信息强纠缠时本方法的局限性。

关键词

引用

@article{arxiv.2302.02997,
  title  = {Erasure of Unaligned Attributes from Neural Representations},
  author = {Shun Shao and Yftah Ziser and Shay Cohen},
  journal= {arXiv preprint arXiv:2302.02997},
  year   = {2023}
}

备注

Accepted to Transactions of the Association for Computational Linguistics, 22 pages (pre-MIT Press publication version)