中文

多模态动作质量评估

信号处理 2025-03-06 v3 人工智能 计算机视觉与模式识别

摘要

动作质量评估(AQA)旨在评估动作执行的好坏程度。以往的研究仅利用视觉信息进行建模,忽略了音频信息。我们认为,尽管 AQA 高度依赖视觉信息,但音频是有益的补充信息,可提高分数回归的准确性,特别是对于花样滑冰和艺术体操等带有背景音乐的体育项目。为了利用 RGB、光流和音频等多模态信息进行 AQA,我们提出了一种渐进式自适应多模态融合网络(PAMFN),该网络分别对模态特定信息和混合模态信息进行建模。我们的模型包含三个模态特定分支,用于独立探索模态特定信息,以及一个混合模态分支,用于渐进式聚合来自模态特定分支的模态特定信息。为了在模态特定分支与混合模态分支之间建立桥梁,我们提出了三个新颖的模块。首先,设计了一个模态特定特征解码器(Modality-specific Feature Decoder)模块,用于选择性地将模态特定信息传递到混合模态分支。其次,在探索模态特定信息之间的交互时,我们认为使用不变的多模态融合策略可能导致次优结果,因此需要考虑动作不同部分的潜在多样性。为此,我们提出了一个自适应融合模块(Adaptive Fusion Module),以学习动作不同部分的自适应多模态融合策略。该模块由多个用于探索不同多模态融合策略的 FusionNets 和一个用于决定启用哪些 FusionNets 的 PolicyNet 组成。第三,设计了一个名为跨模态特征解码器(Cross-modal Feature Decoder)的模块,用于将由自适应融合模块生成的跨模态特征传递到混合模态分支。

关键词

引用

@article{arxiv.2402.09444,
  title  = {Multimodal Action Quality Assessment},
  author = {Ling-An Zeng and Wei-Shi Zheng},
  journal= {arXiv preprint arXiv:2402.09444},
  year   = {2025}
}

备注

IEEE Transactions on Image Processing 2024