中文

LLaVA-ST:用于细粒度时空理解的多模态大语言模型

计算机视觉与模式识别 2025-06-03 v2

摘要

多模态大语言模型(MLLM)的最新进展已展现出有前景的成果,但现有方法在同时有效处理时序和空间定位方面存在挑战。这一挑战源于两个关键问题:首先,引入时空定位会产生大量坐标组合, complicating 语言与视觉坐标表示的对齐;其次,在视频特征压缩过程中编码细粒度时空信息本质上具有困难。为解决这些问题,我们提出了 LLaVA-ST,一种用于细粒度时空多模态理解的 MLLM。在 LLaVA-ST 中,我们提出了语言对齐位置嵌入(Language-Aligned Positional Embedding),将文本坐标特殊标记嵌入视觉空间,从而简化细粒度时空对应关系的对齐。此外,我们设计了时空打包器(Spatial-Temporal Packer),将时序和空间分辨率的特征压缩解耦为两个独立的点到区域注意力处理流。我们还构建了包含 430 万训练样本的 ST-Align 数据集,用于细粒度时空多模态理解。通过 ST-Align,我们提出了一种渐进式训练流程,通过顺序的粗到细阶段对齐视觉和文本特征。此外,我们引入了 ST-Align 基准测试,以评估时空交错的细粒度理解任务,包括时空视频定位(STVG)、事件定位与描述(ELC)以及空间视频定位(SVG)。LLaVA-ST 在 11 个需要细粒度时序、空间或时空交错多模态理解的基准测试中取得卓越成绩。我们的代码、数据和基准将在 https://github.com/appletea233/LLaVA-ST 发布。

关键词

引用

@article{arxiv.2501.08282,
  title  = {LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding},
  author = {Hongyu Li and Jinyu Chen and Ziyu Wei and Shaofei Huang and Tianrui Hui and Jialin Gao and Xiaoming Wei and Si Liu},
  journal= {arXiv preprint arXiv:2501.08282},
  year   = {2025}
}

备注

Accepted by CVPR2025