中文

基于多层大型视觉语言模型的未剪裁视频动作识别

计算机视觉与模式识别 2025-08-26 v1

摘要

动作识别与定位于复杂未剪裁视频中仍是计算机视觉中的艰巨挑战,主要因现有方法在捕获细粒度动作、长期时间依赖性与高层语义信息方面受限于低层视觉特征。本文引入事件上下文化视频转换器(ECVT),一种新型架构,利用大型视觉语言模型(LVLMs)的高级语义理解能力以弥补这一差距。ECVT采用双分支设计,包含视频编码分支用于时空特征提取,以及跨模态指导分支。后者利用LVMM生成多粒度语义描述,包括全局事件提示(Global Event Prompting)用于宏观叙事,以及时间子事件提示(Temporal Sub-event Prompting)用于细粒度动作细节。这些多层文本线索通过如自适应门控用于高层语义融合、跨模态注意力用于细粒度特征细化以及事件图模块用于时序上下文校准等复杂机制整合至视频编码器的学习过程中。以综合损失函数(包含语义一致性与时序校准项)端到端训练,ECVT显著提升了模型理解视频时序结构与事件逻辑的能力。大量实验表明,ECVT在ActivityNet v1.3与THUMOS14数据集上实现了最先进的性能,平均mAP在ActivityNet v1.3上达到40.5%,THUMOS14上[email protected]达到67.1%,超越领先基线。

关键词

引用

@article{arxiv.2508.17442,
  title  = {Multi-Level LVLM Guidance for Untrimmed Video Action Recognition},
  author = {Liyang Peng and Sihan Zhu and Yunjie Guo},
  journal= {arXiv preprint arXiv:2508.17442},
  year   = {2025}
}