中文

Omni-RGPT:通过Token Marks实现图像和视频区域级理解的统一框架

计算机视觉与模式识别 2025-03-25 v2

摘要

我们提出Omni-RGPT,一种旨在促进图像和视频区域级理解的多模态大型语言模型。为实现时空维度上的一致区域表示,我们引入Token Mark——一组在视觉特征空间中突出显示目标区域的标记。这些标记直接通过区域提示(例如框或掩码)嵌入到空间区域中,并同时纳入文本提示以指定目标,从而在视觉标记和文本标记之间建立直接联系。为进一步支持无需tracklets即可实现稳健视频理解,我们引入一个辅助任务,通过利用标记的一致性来指导Token Mark,从而实现视频中区域解释的稳定性。此外,我们引入了一个大规模区域级视频指令数据集(RegVID-300k)。Omni-RGPT在图像和视频基础commonsense推理基准测试中实现了最先进的结果,同时在描述生成和指代表达理解任务中表现出色。

关键词

引用

@article{arxiv.2501.08326,
  title  = {Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks},
  author = {Miran Heo and Min-Hung Chen and De-An Huang and Sifei Liu and Subhashree Radhakrishnan and Seon Joo Kim and Yu-Chiang Frank Wang and Ryo Hachiuma},
  journal= {arXiv preprint arXiv:2501.08326},
  year   = {2025}
}

备注

CVPR 2025, Project page: https://miranheo.github.io/omni-rgpt/