LG-CAV:利用语言引导训练任意概念激活向量
计算机视觉与模式识别
2024-10-15 v1
摘要
概念激活向量(CAV)因其优雅地对模型预测归因于特定概念之而引发广泛研究兴趣。然而,CAV的训练往往需要大量高质量图像,而这些图像在筛选上成本高昂,因而仅限于预定义的概念集合。为此,我们提出语言引导概念激活向量(Language-Guided CAV,LG-CAV)以利用预训练视觉语言模型(如 CLIP)中丰富的概念知识。该方法通过利用对应的概念描述作为指导,使能够在无标记数据的情况下训练任何 CAV。为在视觉语言模型与目标模型之间架起桥梁,我们计算在常见图像池(探测图像)上对概念描述的激活值,并将其用作语言指导来训练 LG-CAV。此外,在训练与目标模型预测的所有类别相关的高质量 LG-CAV后,我们提出了激活样本重加权(activation sample reweighting,ASR),作为一种模型校正技术,以改善目标模型的性能。实验在四个数据集上进行,涵盖九种网络架构,结果表明 LG-CAV 在给定任何概念时均显著优于以往 CAV 方法,而我们的模型校正方法在与现有概念基方法比较时实现了最佳性能。我们的代码已公开于 https://github.com/hqhQAQ/LG-CAV。
引用
@article{arxiv.2410.10308,
title = {LG-CAV: Train Any Concept Activation Vector with Language Guidance},
author = {Qihan Huang and Jie Song and Mengqi Xue and Haofei Zhang and Bingde Hu and Huiqiong Wang and Hao Jiang and Xingen Wang and Mingli Song},
journal= {arXiv preprint arXiv:2410.10308},
year = {2024}
}