中文

基于多模态大语言模型引导的双先验协作学习的弱监督时序动作定位

计算机视觉与模式识别 2025-06-10 v2

摘要

多模态大语言模型(MLLM)的最新突破在深度学习界获得广泛认可,视频基础模型(VFM)与大语言模型(LLM)的融合在构建鲁棒视频理解系统方面发挥关键作用,有效克服了预定义视觉任务的局限。这些复杂的MLLM展现出卓越的视频理解能力,在多个基准上迅速达到前所未有的性能水平。然而,其运行需要大量内存和计算资源,凸显了传统模型在视频理解任务中持续的重要性。本文提出了一种名为MLLM4WTAL的新学习范式。该范式利用MLLM为传统弱监督时序动作定位(WTAL)方法提供时序动作关键语义和完整语义先验。MLLM4WTAL通过整合两个不同模块:关键语义匹配(KSM)和完整语义重建(CSR),在MLLM引导下增强WTAL。这两个模块协同工作,有效解决WTAL方法中常见的不完整和过完整结果问题。严格实验验证了我们提出的方法在提升各类异构WTAL模型性能方面的有效性。

关键词

引用

@article{arxiv.2411.08466,
  title  = {Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models},
  author = {Quan Zhang and Jinwei Fang and Rui Yuan and Xi Tang and Yuxin Qi and Ke Zhang and Chun Yuan},
  journal= {arXiv preprint arXiv:2411.08466},
  year   = {2025}
}

备注

Accepted to CVPR