中文

ViCaS:用于结合整体和像素级视频理解的数据集,利用带有 grounding 分割的描述

计算机视觉与模式识别 2025-04-04 v3

摘要

最近的多模态大语言模型(MLLM)进展不断,使视频理解研究主要聚焦于高层次任务,如视频描述和问答。同时,较少数量的工作则涉及密集、像素精细的分割任务,通常基于类别引导或指代式对象分割。尽管这两个方向对开发具备人类水平视频理解能力的模型至关重要,但它们 largely 独立发展,拥有各自不同的基准和架构。本文旨在通过引入 ViCaS 数据集来统一这些努力,该数据集包含数千个具有挑战性的视频,每个视频都标注有详细的人工撰写的描述以及多个对象的时间一致、像素精确的掩码,并实现短语 grounding。我们的基准在整体/高层次理解和语言引导的像素精确分割之间进行评估。我们还提出了经过仔细验证的评估措施,并提出一种有效的模型架构,可解决我们的基准。项目页面:https://ali2500.github.io/vicas-project/

关键词

引用

@article{arxiv.2412.09754,
  title  = {ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation},
  author = {Ali Athar and Xueqing Deng and Liang-Chieh Chen},
  journal= {arXiv preprint arXiv:2412.09754},
  year   = {2025}
}

备注

Accepted to CVPR 2025. Project page: https://ali2500.github.io/vicas-project/