TRoVe: 发现时序视觉语言模型中引发错误的静态特征偏置
计算机视觉与模式识别
2025-12-02 v1
摘要
视觉语言模型 (VLMs) 在解决涉及理解图像序列中视觉变化的时序任务方面取得了很大进展,但最近的研究表明,这些模型在做出预测时可能依赖静态特征偏置,如背景或物体特征,而非动态视觉变化。静态特征偏置是一种类比,可能导致下游任务中系统性预测错误;因此,在实际部署前识别和刻画错误引发的静态特征偏置至关重要。本文介绍 TRoVe,一种用于发现由时序 VLMs 学习的错误引发静态特征偏置的自动方法。给定训练好的 VLM 和与下游分类任务相关的标注验证数据集,TRoVe 从数据集中提取候选静态特征,并通过 (i) 该特征对分类错误的影响以及 (ii) VLM 在做出预测时对该特征的依赖程度,对每个特征进行评分。为了定量评估 TRoVe,我们引入一个评估框架,包含 101 个训练好的时序 VLMs 配合所学静态特征偏置的真实标注。我们使用该框架表明,TRoVe 能够准确识别 VLMs 中错误引发的静态特征偏置,相较于最近的基线实现了 28.6% 的改进。最后,我们将 TRoVe 应用于 7 个即插即用 VLMs 和 2 个时序理解任务,揭示了 previously-unknown 的静态特征偏置,并表明对已学习偏置的了解可帮助在测试时提高模型性能。我们的代码已公开于 https://github.com/Stanford-AIMI/TRoVe。
引用
@article{arxiv.2512.01048,
title = {TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language Models},
author = {Maya Varma and Jean-Benoit Delbrouck and Sophie Ostmeier and Akshay Chaudhari and Curtis Langlotz},
journal= {arXiv preprint arXiv:2512.01048},
year = {2025}
}
备注
NeurIPS 2025