中文

MLVTG: 基于Mamba的特征对齐与LLM驱动的多模态视频时序定位纯化

计算机视觉与模式识别 2026-01-28 v2 人工智能

摘要

视频时序定位(VTG)旨在定位与自然语言查询对应的视频片段,是视频理解中一项基础且具有挑战性的任务。基于Transformer的现有方法常受冗余注意力和次优多模态对齐的困扰。为解决这些局限,我们提出MLVTG,一个融合两个关键模块的新型框架:MambaAligner和LLMRefiner。MambaAligner采用堆叠的Vision Mamba模块作为骨干网络,替代Transformer以建模时序依赖并提取鲁棒的视频表示用于多模态对齐。LLMRefiner利用预训练大语言模型(LLM)的特定冻结层隐式迁移语义先验,在不进行微调的情况下增强多模态对齐。这种双重对齐策略——通过结构化状态空间动力学进行时序建模,以及通过文本先验进行语义纯化——实现了更精确的定位。在QVHighlights、Charades-STA和TVSum上的广泛实验表明,MLVTG达到了最先进的性能,并显著超越了现有基线。

关键词

引用

@article{arxiv.2506.08512,
  title  = {MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding},
  author = {Zhiyi Zhu and Xiaoyu Wu and Zihao Liu and Linlin Yang},
  journal= {arXiv preprint arXiv:2506.08512},
  year   = {2026}
}