基于后置概念瓶颈的可解释生成模型
计算机视觉与模式识别
2025-03-26 v1 机器学习
摘要
概念瓶颈模型(CBM)旨在产生基于人类可理解概念以进行预测的内在可解释模型。然而,现有基于CBM的可解释生成模型方法尚不高效和不可扩展,因其需要从头开始进行昂贵的生成模型训练,以及需要耗时的概念监督。为此,本文提出两种新颖且低成本的方法,通过后置技术构建可解释的生成模型,我们命名为概念瓶颈自编码器(CB-AE)和概念控制器(CB-AE)。我们的方法无需真实数据,仅需最小程度甚至不需要概念监督,即可实现高效和可扩展的训练。此外,我们的方法跨越现代生成模型家族,包括生成对抗网络和扩散模型。我们在CelebA、CelebA-HQ和CUB等多个标准数据集上演示了方法的可解释性和可操控性,平均性能比以前工作提高约25%,训练速度快4-15倍。最后,进行了大规模用户研究,以验证方法的可解释性和可操控性。
引用
@article{arxiv.2503.19377,
title = {Interpretable Generative Models through Post-hoc Concept Bottlenecks},
author = {Akshay Kulkarni and Ge Yan and Chung-En Sun and Tuomas Oikarinen and Tsui-Wei Weng},
journal= {arXiv preprint arXiv:2503.19377},
year = {2025}
}
备注
CVPR 2025. Project Page: https://lilywenglab.github.io/posthoc-generative-cbm/