中文

通过文本描述去偏:缓解视频基准中的表示偏差

计算机视觉与模式识别 2025-03-25 v1

摘要

我们提出了一种新的“通过文本描述去偏(UTD)”视频基准,该基准基于现有视频分类与检索数据集的无偏子集,以实现对视频理解能力的更稳健评估。具体而言,我们解决了当前视频基准可能存在不同表示偏差的问题,例如物体偏差或单帧偏差,在这些情况下,仅识别物体或仅利用单帧就足以做出正确预测。我们利用VLM和LLM来分析并消除基准中的此类表示偏差。具体来说,我们生成视频的逐帧文本描述,针对特定信息(例如仅物体)进行过滤,并利用它们从三个维度检验表示偏差:1)概念偏差——确定仅凭特定概念(例如物体)是否足以进行预测;2)时间偏差——评估时间信息是否对预测有贡献;3)常识与数据集偏差——评估零样本推理或数据集相关性是否对预测有贡献。我们对12个流行的视频分类与检索数据集进行了系统分析,并为这些数据集创建了新的物体去偏测试集划分。此外,我们在原始划分和去偏划分上对30个state-of-the-art视频模型进行了基准测试,并分析了模型中的偏差。为了促进未来更稳健的视频理解基准和模型的开发,我们发布了:“UTD-descriptions”,一个包含每个数据集丰富结构化描述的数据集,以及“UTD-splits”,一个包含物体去偏测试集划分的数据集。

关键词

引用

@article{arxiv.2503.18637,
  title  = {Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks},
  author = {Nina Shvetsova and Arsha Nagrani and Bernt Schiele and Hilde Kuehne and Christian Rupprecht},
  journal= {arXiv preprint arXiv:2503.18637},
  year   = {2025}
}

备注

To be published at CVPR 2025, project webpage https://utd-project.github.io/