中文

对数线性防护性及其启示

机器学习 2024-05-14 v5 计算与语言

摘要

假设线性、用于从神经表征中擦除人类可解释概念的方法已被发现是易处理且有用的。然而,这种移除对基于修改后表征训练的下游分类器行为的影响尚未被充分理解。本工作中,我们形式化定义对数线性防护性为对手无法直接由表征预测该概念,并研究其启示。我们表明,在二值情形下,于特定假设下,下游对数线性模型无法恢复被擦除概念。但我们证明可构造多类对数线性模型在部分情形下间接恢复该概念,这指向对数线性防护性作为下游偏差缓解技术的固有局限。这些发现阐明了线性擦除方法的理论局限,并凸显进一步研究神经模型中内在偏差与外在偏差联系的必要。

关键词

引用

@article{arxiv.2210.10012,
  title  = {Log-linear Guardedness and its Implications},
  author = {Shauli Ravfogel and Yoav Goldberg and Ryan Cotterell},
  journal= {arXiv preprint arXiv:2210.10012},
  year   = {2024}
}

备注

Accepted as a long paper in ACL 2023