针对多选题答题的盲测 guessing:通过视频语言模型校准选择偏差
计算与语言
2025-06-02 v2
摘要
评估视频语言模型(VLMs)颇具挑战性。由于其透明度,多选题答题(MCQA)被广泛用于衡量这些模型的性能。然而,现有的 MCQA 基准缺乏对 VLMs 完全推理能力的捕捉,由于选择偏差,当模型在训练过程中过度偏向于基于位置模式等任意答案选项时,便会偏离正确答案。本文对几种 VLM 架构在旨�量衡量复杂视频推理能力的主要数据集进行了全面实证分析。我们识别了偏差最为显著的地点,并展示了模型响应反映对视频内容及相关问题真正理解程度,以及与依赖任意模式或浅层线索(如答案位置)相比,到什么程度上存在差异。通过分解 MCQA 任务并将公平性偏差指标适用于 VLMs,我们引入一种后处理校准技术 BOLD,以平衡这种偏差。我们的结果表明,减少选择偏差不仅改善了去偏差指标,还提升了整体模型性能,包括准确率和 F1 均值。该方法通过抑制“盲测 guessing”,提供了比现有技术更具成本和时间效益的选择偏差缓解方法。这一研究代表了对视频到文本 LLM 驱动模型中选择偏差的首次专门调查。
引用
@article{arxiv.2410.14248,
title = {Addressing Blind Guessing: Calibration of Selection Bias in Multiple-Choice Question Answering by Video Language Models},
author = {Olga Loginova and Oleksandr Bezrukov and Ravi Shekhar and Alexey Kravets},
journal= {arXiv preprint arXiv:2410.14248},
year = {2025}
}