中文

利用基础模型进行基于多模态图的动作识别

计算机视觉与模式识别 2025-10-08 v2

摘要

基础模型的出现带来了多模态视频理解的新时代,通过提取丰富的时空和语义表示。本文引入一种新颖的图基框架,集成视觉语言基础模型,利用 VideoMAE 进行动态视觉编码和 BERT 进行语境文本嵌入,以解决识别精细双手操作动作的挑战。不同于常规静态图架构,我们的方法构建自适应多模态图,其中节点代表帧、物体和文本注释,边缘编码空间、时间和语义关系。这些图结构根据所学习的相互作用动态演化,允许灵活且语境感知的推理。在图注意力网络中的任务特定注意力机制进一步通过调制动作语义的边缘重要性来增强这种推理。在多样化基准数据集上的广泛评估表明,我们的方法在持续优于最先进的基线方法,凸显了将基础模型与动态图基推理结合用于稳健和可泛化动作识别的优势。

关键词

引用

@article{arxiv.2505.15192,
  title  = {Leveraging Foundation Models for Multimodal Graph-Based Action Recognition},
  author = {Fatemeh Ziaeetabar and Florentin Wörgötter},
  journal= {arXiv preprint arXiv:2505.15192},
  year   = {2025}
}