中文

SAMA:面向大语言模型的多轮Referential Grounded Video Chat

计算机视觉与模式识别 2025-10-27 v2

摘要

在视频中实现细粒度时空理解仍是当前视频大型多模态模型(Video LMM)面临的主要挑战。解决这一挑战需要掌握两项核心能力:视频指代理解,捕捉视频区域的语义;视频定位,将对象区域基于自然语言描述进行分段。然而,现有大多数方法都将这两个任务置于孤立的环境中,限制了向统一、指代导向的视频交互进程。我们识别出一个关键瓶颈:缺乏高质量、统一的视频指令数据以及用于评估指代导向视频对话的全面基准。为此,我们在三个核心方面做出贡献:数据集、模型和基准。首先,我们引入了 SAMA-239K,一个大型数据集,包含 15K 个视频,旨在启用视频指代理解、定位和多轮视频对话的联合学习。其次,我们提出了 SAMA 模型,融合了多功能时空上下文聚合器和 Segment Anything Model,以联合增强细粒度视频理解和精确定位能力。最后,我们建立了 SAMA-Bench,一个精心设计的基准,包含 5,067 个来自 522 个视频的问题,全面评估 Video LMM 在多轮、时空指代理解和 grounded 对话中的集成能力。大量实验和基准结果表明,SAMA 不仅在 SAMA-Bench 上取得优异成绩,还在一般定位基准上实现了新的最佳性能,同时在标准视觉理解基准上保持高度具竞争力的性能。

关键词

引用

@article{arxiv.2505.18812,
  title  = {SAMA: Towards Multi-Turn Referential Grounded Video Chat with Large Language Models},
  author = {Ye Sun and Hao Zhang and Henghui Ding and Tiehua Zhang and Xingjun Ma and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2505.18812},
  year   = {2025}
}

备注

NeurIPS 2025