基于核化率失真最大化的鲁棒概念擦除
机器学习
2023-12-04 v1 计算与语言
摘要
分布式表示提供了一个捕获数据实例间有意义关系的向量空间。然而,这些表示的分布式特性将多个属性或数据实例的概念(例如文本的主题或情感、作者特征(年龄、性别等))纠缠在一起。近期工作提出了概念擦除任务,其目标不是使某个概念可预测,而是从分布式表示中移除某一属性,同时尽可能保留原始表示空间中的其他信息。本文中,我们提出一种基于距离度量学习的新目标——核化率失真最大化器(KRaM),用于执行概念擦除。KRaM 利用修正的率失真函数拟合表示的变换,以匹配指定的距离度量(由待擦除的带标签概念定义)。具体而言,KRaM 的目标函数旨在使具有相似概念标签的实例在所学表示空间中不相似,同时保留其他信息。我们发现优化 KRaM 可有效擦除多种类型的概念:来自不同领域数据表示中的类别型、连续型和向量值变量。我们还对 KRaM 目标函数的若干性质提供了理论分析。为评估所学表示的质量,我们提出一种对齐分数来衡量其与原始表示空间的相似度。此外,我们开展实验展示 KRaM 在各种设置下的有效性,从擦除词嵌入中的二元性别变量到 GPT-3 表示中的向量值变量。
引用
@article{arxiv.2312.00194,
title = {Robust Concept Erasure via Kernelized Rate-Distortion Maximization},
author = {Somnath Basu Roy Chowdhury and Nicholas Monath and Avinava Dubey and Amr Ahmed and Snigdha Chaturvedi},
journal= {arXiv preprint arXiv:2312.00194},
year = {2023}
}
备注
NeurIPS 2023