中文

核化概念擦除

机器学习 2024-09-17 v6 计算与语言

摘要

文本数据神经模型的表示空间在训练过程中以无监督方式涌现。理解这些表示如何编码人类可解释的概念是一个基本问题。识别神经表示中概念的一种主流方法是搜索一个线性子空间,擦除该子空间可防止从表示中预测该概念。然而,尽管许多线性擦除算法是可处理且可解释的,神经网络并不一定以线性方式表示概念。为识别非线性编码的概念,我们提出了一种用于概念擦除的线性极小极大博弈的核化方法。我们证明,可以阻止特定的非线性对手预测该概念。然而,这种保护不能迁移到不同的非线性对手。因此,彻底擦除非线性编码的概念仍是一个开放问题。

关键词

引用

@article{arxiv.2201.12191,
  title  = {Kernelized Concept Erasure},
  author = {Shauli Ravfogel and Francisco Vargas and Yoav Goldberg and Ryan Cotterell},
  journal= {arXiv preprint arXiv:2201.12191},
  year   = {2024}
}

备注

Accepted as a long paper in EMNLP22