VidLBEval:面向视频参与型大视觉语言模型的语言偏见基准测试与缓解
计算机视觉与模式识别
2025-02-25 v1 人工智能
摘要
最近,大视觉语言模型(LVLMs)在多种多模态任务和基准测试中取得了显著进展。本文揭示了一个在现有视频参与型LVLMs中鲜有人关注的问题——语言偏见,即模型倾向于优先考虑语言而非视频,从而导致错误响应。为解决这一研究空白,我们首先收集了一个视频语言偏见评估基准测试,专为评估视频参与型LVLMs的语言偏见而设计,包含两个关键任务:模糊视频对比和疑问性问题探测。相应地,我们设计了旨在惩罚LVLMs受语言偏见影响的评估指标。此外,我们还提出了多分支对抗解码(MCD),通过引入两个专家分支同时抵消文本-only分支可能产生的语言偏见。我们的实验表明:i)包括专有和开源模型在内的现有视频参与型LVLMs在很大程度上受到语言偏见问题的限制;ii)我们的MCD能够有效缓解这一问题,并在各种视频参与型LVLMs中保持通用能力,而无需额外 retraining 或修改模型架构。
引用
@article{arxiv.2502.16602,
title = {VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs},
author = {Yiming Yang and Yangyang Guo and Hui Lu and Yan Wang},
journal= {arXiv preprint arXiv:2502.16602},
year = {2025}
}