DeAR:通过分解注意力头角色实现细粒度 VLM 适应
计算机视觉与模式识别
2026-03-10 v2
摘要
提示学习是适用于预训练视觉语言模型 (VLM) 进行下游任务适应的主导范式。然而,现有方法常依赖单简、以层为中心的观点,假设浅层捕获通用特征而深层处理任务特定知识。这一假设导致可控的 learnable tokens 与原始 tokens 之间的交互,任务特定知识可能损害模型的核心泛化能力,并在任务适应与零-shot 泛化保持之间产生权衡。为此,我们挑战以层为中心的观点,提出 \textbf{DeAR} 框架,通过 \textbf{De} 构 \textbf{A}ttention head \textbf{R} oles 实现细粒度 VLM 适应。我们认为,VLM 内部的功能专化并非发生在层之间,而是在更细粒度的注意力头级别上。基于此洞察,我们引入一种新型度量 Concept Entropy,用于系统性地将注意力头分类为三个 distinct 功能角色:\textit{Attribute}、\textit{Generalization} 和 \textit{Mixed}。在这些角色的指导下,我们引入专用的 attribute tokens 和基于角色的注意力掩码机制,以精确控制信息流动,确保 generalization 头保持与任务特定知识的隔离。我们进一步采用任务自适应融合策略进行推理。在 15 个数据集上的大量实验表明,DeAR 在任务适应与泛化之间实现了强大的平衡,净化化在各种任务上均优于先前方法。
引用
@article{arxiv.2603.01111,
title = {DeAR: Fine-Grained VLM Adaptation by Decomposing Attention Head Roles},
author = {Yiming Ma and Hongkun Yang and Lionel Z. Wang and Bin Chen and Weizhi Xian and Jianzhi Teng},
journal= {arXiv preprint arXiv:2603.01111},
year = {2026}
}
备注
Accepted by CVPR 2026