模态特定偏移下视觉-语言模型的优化控制引导测试时自适应
计算机视觉与模式识别
2026-05-05 v2
摘要
视觉-语言模型在零样本设置下具有良好的迁移能力,但在部署时,视觉和文本分支往往会发生不对称偏移。在这种情况下,基于熵的测试时自适应在锐化融合后验的同时可能会增加错误,因为不可靠的模态可能仍然主导融合过程。我们通过多模态后验的优化控制视角研究了这种失效模式,并将自适应转化为融合预测上的约束解混问题。基于这一视角,我们提出了 MG-MTTA,该方法保持主干网络冻结,仅更新轻量级门控或适配器。其目标将融合后验熵最小化与基于锚点的模态一致性和跨模态冲突构建的可靠性感知门控先验相结合。我们的分析给出了熵降低保持正确排序的条件,以及表征模态支配失效的阈值。在基于 ImageNet 的基准测试中,MG-MTTA 在语义保留的文本偏移下将 top-1 准确率从 57.97 提升至 66.51,在联合视觉-文本偏移下从 21.68 提升至 26.27,同时在纯视觉基准测试中保持竞争力。这些结果表明,多模态测试时自适应应控制模态可靠性,而不仅仅是预测熵。
引用
@article{arxiv.2604.24602,
title = {Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift},
author = {Lixian Chen and Yanhui Chen and Junyi Lin},
journal= {arXiv preprint arXiv:2604.24602},
year = {2026}
}