事后概念解耦:从相关到孤立的概念表示
计算机视觉与模式识别
2025-03-10 v1 人工智能
机器学习
摘要
概念激活向量(CAVs)被广泛用于将人类可理解的概念建模为神经网络潜在空间中的方向。它们通过从概念样本与非概念样本的激活中识别方向来训练。然而,该方法对于相关概念(例如 CelebA 数据集中经常在男性图像中共同出现的“胡须”和“领带”)通常会产生相似且非正交的方向。这种耦合使得孤立地解释概念变得复杂,并可能在 CAV 应用(如激活引导)中导致非预期效果。为解决这一问题,我们引入了一种事后概念解耦方法,该方法采用非正交性损失,在保持方向正确性的同时促进正交概念方向的识别。我们在 CelebA 中的真实世界和受控相关概念以及具有 VGG16 和 ResNet18 架构的合成 FunnyBirds 数据集上评估了我们的方法。我们进一步展示了正交化概念表示在激活引导任务中的优越性,与基线 CAVs 相比,允许 (1) 通过生成模型将孤立概念插入到输入图像中,以及 (2) 移除概念以有效抑制捷径,同时减少对相关概念的影响。
引用
@article{arxiv.2503.05522,
title = {Post-Hoc Concept Disentanglement: From Correlated to Isolated Concept Representations},
author = {Eren Erogullari and Sebastian Lapuschkin and Wojciech Samek and Frederik Pahde},
journal= {arXiv preprint arXiv:2503.05522},
year = {2025}
}