先解耦再对齐:视觉解耦增强提示调优
计算机视觉与模式识别
2025-08-04 v1 人工智能
摘要
提示调优(Prompt Tuning, PT)作为一种新兴的资源高效微调范式,在提升视觉-语言模型的任务特定迁移能力方面展现出显著效果。本文深入探讨了 PT 中一个先前被忽视的信息不对称问题:视觉模态通常比面向对象的文本模态承载更多上下文。相应地,粗略地对齐这两种模态可能导致注意力偏置,使模型仅关注上下文区域。为此,我们提出了 DAPT,一种基于直观"先解耦再对齐"概念的 PT 框架。首先,我们通过利用粗粒度与细粒度视觉分割线索,将视觉模态显式解耦为前景与背景表示,然后将这些解耦后的模式分别与原始前景文本及人工构造的背景类别进行对齐,从而对称地强化模态对齐。为进一步增强视觉聚焦度,我们提出了一种针对前景-背景模式的视觉拉推正则化,引导原始视觉表示对感兴趣区域产生无偏注意力。我们在少样本学习、基类到新类泛化以及数据高效学习等任务上验证了无架构依赖的 DAPT 的强大能力,所有任务在主流基准上均取得了优异性能。代码将发布于 https://github.com/Ferenas/DAPT。
引用
@article{arxiv.2508.00395,
title = {Decouple before Align: Visual Disentanglement Enhances Prompt Tuning},
author = {Fei Zhang and Tianfei Zhou and Jiangchao Yao and Ya Zhang and Ivor W. Tsang and Yanfeng Wang},
journal= {arXiv preprint arXiv:2508.00395},
year = {2025}
}
备注
16 pages, Accepted at IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)