中文

VUDG:面向视频理解领域泛化的数据集

计算机视觉与模式识别 2025-06-02 v1

摘要

近年来,视频理解取得了显著进展,这在很大程度上得益于深度模型的进步和大规模标注数据集的可用性。然而,现有工作通常忽略了现实世界视频应用中固有的领域偏移,导致视频理解中的领域泛化(DG)研究尚不充分。因此,我们提出了视频理解领域泛化数据集(VUDG),这是一个专门设计用于评估视频理解中DG性能的新型数据集。VUDG包含来自11个不同领域的视频,涵盖三种类型的领域偏移,并在不同领域间保持语义相似性,以确保公平且有意义的评估。我们提出了一种多专家渐进式标注框架,为每个视频标注多项选择和开放式问答对。在9个代表性大型视频语言模型(LVLMs)和几种传统视频问答方法上的广泛实验表明,大多数模型(包括最先进的LVLMs)在领域偏移下会出现性能下降。这些结果突出了VUDG带来的挑战以及当前模型对数据分布偏移的鲁棒性差异。我们相信VUDG为推动未来领域泛化视频理解的研究提供了宝贵资源。

关键词

引用

@article{arxiv.2505.24346,
  title  = {VUDG: A Dataset for Video Understanding Domain Generalization},
  author = {Ziyi Wang and Zhi Gao and Boxuan Yu and Zirui Dai and Yuxiang Song and Qingyuan Lu and Jin Chen and Xinxiao Wu},
  journal= {arXiv preprint arXiv:2505.24346},
  year   = {2025}
}