中文

MaskCaptioner:学习在视频中联合分割和描述物体轨迹

计算机视觉与模式识别 2025-10-31 v2 人工智能 机器学习

摘要

稠密视频物体描述(DVOC)是联合检测、跟踪和描述视频中物体轨迹的任务,需要理解时空细节并以自然语言描述它们。由于任务的复杂性以及手动标注的高成本,先前的方法采用离散的训练策略,可能导致次优性能。为规避此问题,我们提出利用最先进的视觉语言模型(VLM)生成关于时空局部化实体的描述。通过我们为 LVIS 和 LV-VIS 数据集添加合成描述(LVISCap 和 LV-VISCap),我们训练了 MaskCaptioner——一个能够联合检测、分割、跟踪和描述物体轨迹的端到端模型。此外,基于 LVISCap 和 LV-VISCap 的预训练,MaskCaptioner 在三个现有基准测试(VidSTG、VLN 和 BenSMOT)上实现了 DVOC 的最先进结果。数据集和代码均可在 https://www.gabriel.fiastre.fr/maskcaptioner/ 获取。

关键词

引用

@article{arxiv.2510.14904,
  title  = {MaskCaptioner: Learning to Jointly Segment and Caption Object Trajectories in Videos},
  author = {Gabriel Fiastre and Antoine Yang and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2510.14904},
  year   = {2025}
}

备注

20 pages, 8 figures