面向时序动作定位的视觉语言模型模态偏置缓解策略
计算机视觉与模式识别
2026-04-14 v3
摘要
时序动作定位需要识别视频中动作的边界和类别。虽然视觉语言模型(VLM)提供丰富的语义信息以补充视觉证据,但现有方法倾向于过度强调语言先验,以牺牲视觉性能,导致显著的模态偏置。我们提出ActionVLM,一种系统性缓解时序动作定位中模态偏置的视觉语言聚合框架。我们的关键洞察是保持视觉作为主导信号,同时在有益时适应性地利用语言。为此,我们引入(i)一个校正重加权模块,估计语言优势——即语言相对于视觉单一预测的增量效益——并动态调整语言模态的权重;(ii)一种残差聚合策略,将语言视为补充性的细化,而非主要驱动力。这种组合缓解了模态偏置,减少了来自语言先验的过度自信,并强化了时序推理。在THUMOS14数据集上的实验表明,我们的模型在mAP上比最先进的方法提高了最高可达3.2%。我们的代码已公开于https://github.com/JiaqiLi404/ActionVLM
引用
@article{arxiv.2601.21078,
title = {Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization},
author = {Jiaqi Li and Guangming Wang and Shuntian Zheng and Minzhe Ni and Xiaoman Lu and Guanghui Ye and Yu Guan},
journal= {arXiv preprint arXiv:2601.21078},
year = {2026}
}