从因果视角重新思考视觉语言模型适应中的对齐问题
计算机视觉与模式识别
2024-11-06 v2 计算与语言
机器学习
摘要
基础视觉语言模型如CLIP在下游任务中展现出惊人的泛化能力。然而,CLIP在适应特定任务时存在两级对齐问题,即任务对齐和数据对齐。软提示调谐已缓解任务对齐问题,但数据对齐仍然是一个挑战。为分析数据对齐的影响,我们重新审视了CLIP的预训练和适应过程,构建了结构因果模型。我们发现,尽管我们期望准确捕获下游任务中任务相关的信息,但任务无关的知识会影响预测结果并阻碍对图像与预测类别之间真实关系的建模。由于任务无关的知识不可观测,我们利用前门调整方法,提出了基于因果引导的语义解耦与分类(CDC),以减轻任务无关知识的干扰。具体而言,我们解耦下游任务数据中包含的语义,并基于每种语义进行分类。此外,我们采用Dempster-Shafer证据理论评估由不同语义生成的每个预测的不确定性。在多种不同设置下的实验结果一致表明,CDC的有效性。
引用
@article{arxiv.2410.12816,
title = {Rethinking Misalignment in Vision-Language Model Adaptation from a Causal Perspective},
author = {Yanan Zhang and Jiangmeng Li and Lixiang Liu and Wenwen Qiang},
journal= {arXiv preprint arXiv:2410.12816},
year = {2024}
}
备注
Accepted by NeurIPS 2024