MASRA:面向视频时间定位的MLLM辅助语义-关系一致对齐
计算机视觉与模式识别
2026-05-06 v1
摘要
视频时间定位(VTG)面临跨模态语义鸿沟,导致背景特征被错误地对齐到查询上,而直接将查询匹配到时段又导致时序语义的判别性和一致性不足。为此,我们提出MLLM辅助语义-关系一致对齐(MASRA),这是一种面向VTG的训练时MLLM优化框架。MASRA利用MLLM在训练期间生成两种形式的文本先验:带时间跨度的事件级别描述和片段级别标题,并实现两种MLLM辅助对齐。事件语义时间对齐(ESTA)将时间上下文与事件语义对齐,以明确强化语义与时间事件之间的对应关系,提高时段级别的可分离性。局部关系一致性对齐(LRCA)构建源自片段级别标题的文本关系矩阵,并与模型中的时间特征相似度矩阵对齐,以增强时间一致性同时捕获局部结构信息。MASRA包含两个简单的支持模块:语义引导的增强和二阶关系注意力,以更好地利用所学的语义上下文和关系结构。此外,我们引入解耦式对齐交互(DAI),以上下文感知的码本自适应吸收查询无关的语义,缓解跨模态鸿沟。MLLM仅在训练时调用,推理期间不使用。大量实验表明,MASRA超过了现有方法,消融研究验证了其有效性。
引用
@article{arxiv.2605.03398,
title = {MASRA: MLLM-Assisted Semantic-Relational Consistent Alignment for Video Temporal Grounding},
author = {Ran Ran and Jiwei Wei and Shuchang Zhou and Yitong Qin and Shiyuan He and Zeyu Ma and Yuyang Zhou and Yang Yang},
journal= {arXiv preprint arXiv:2605.03398},
year = {2026}
}