所有单层都有帮助吗?对视觉语言模型中任务干扰层的实证研究
人工智能
2026-05-18 v1
摘要
当前视觉语言模型(VLM)已在广泛的多模态任务上展示了能力。通常情况下,预训练 VLM 中的所有层默认参与下游任务的预测。我们发现,对单层进行干预(例如置零其参数)可提升某些任务的性能,表明某些层反而会阻碍下游任务。我们系统性地研究了单个层如何影响不同任务,通过层级干预手段。具体而言,我们衡量干预每个层后相对于基线模型的性能变化,并观察到跳过特定层可带来性能提升。这种提升在不同模型和数据集间具有可通用性,表明存在会损害下游任务性能的任务干扰层(Task-Interfering Layers)。我们提出任务-层交互向量(Task-Layer Interaction Vector),用于量化给定任务下干预 VLM 每一层的效果。这些任务干扰层 exhibits 任务特定的灵敏度模式:需要类似能力的任务在层级干预下表现出一致的响应趋势,证据在于其高相似性的任务-层交互向量。基于上述发现,我们提出 TaLo(Task-Adaptive Layer Knockout),一种基于训练的无需参数更新的测试时适应方法,动态识别并跳过给定任务的最干扰层。TaLo 在多种模型和数据集上均能提升性能,包括将 Qwen-VL 在 ScienceQA 地图任务上的准确率提升最高 16.6%。我们的工作揭示了预训练 VLM 中意想不到的模块化形式,提供了一种即插即用、无需训练的机制,以推动推理时隐藏能力的释放。源码将公开发布。
引用
@article{arxiv.2602.01167,
title = {Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Models},
author = {Zhiming Liu and Yujie Wei and Lei Feng and Xiu Su and Xiaobo Xia and Weili Guan and Zeke Xie and Shuo Yang},
journal= {arXiv preprint arXiv:2602.01167},
year = {2026}
}