理解视觉语言模型中的任务迁移
计算机视觉与模式识别
2026-04-10 v2 机器学习
摘要
视觉语言模型(VLMs)在多模态基准测试中表现良好,但在深度估计或目标计数等视觉感知任务上仍落后于人类和专用模型。对一个任务进行微调后,对其他任务性能的影响是不可预测的,这使得基于任务的微调变得具有挑战性。本文通过系统性研究任务可迁移性来解决这一挑战。我们考察了在一个感知任务上进行微调后,对其他任务零样本性能的影响。我们引入了完美间隙因子(PGF),作为衡量任务迁移影响性能变化的归一化指标。我们利用 PGF 计算任务可迁移性,这捕捉了源任务引发的迁移的广度和幅度。通过在三个开源 VLMs 上评估,并覆盖 13 个感知任务,我们构建了任务迁移图谱,揭示了之前未观察到的感知任务之间的关系。我们的分析发现了正向和负向迁移模式,识别了彼此相互影响的任务组,基于其迁移行为将任务组织为若干“人格”,并演示了 PGF 如何指导数据选择以实现更高效的训练。这些发现既凸显了正向迁移的机遇,也凸显了负向干扰的风险,为推动 VLMs 的发展提供了可操作的指导。
引用
@article{arxiv.2511.18787,
title = {Understanding Task Transfer in Vision-Language Models},
author = {Bhuvan Sachdeva and Karan Uppal and Abhinav Java and Vineeth N. Balasubramanian},
journal= {arXiv preprint arXiv:2511.18787},
year = {2026}
}
备注
CVPR 2026 (Oral)