PIDNet:用于多模态动作质量评估的渐进式隐式解耦网络
计算机视觉与模式识别
2026-05-12 v1
摘要
动作质量评估 (AQA) 旨在自动量化人类动作在视频中的执行质量,对于诸如体育竞技评判等应用具有重要价值。在多模态 AQA 中,来自不同模态的质量证据是异构的,质量线索会随时间逐步演变。现有方法常依赖粗糙融合或统一的时间建模,这可能模糊模态特定的线索、保留跨模态冗余并削弱阶段特定的质量证据。为此,我们提出一种渐进式隐式解耦和融合网络 (PIDNet),该网络逐步整合模态特定信息、跨模态互补线索和全局质量语义,以实现精确评估。具体而言,我们设计了一个 iMambaWave 模块,将 RGB、光流和音频特征映射到共享的潜在空间,并通过 Bi-Mamba 分支和小波变换分支分别解耦,以捕获长程时序依赖和局部扰动细节。一个门控聚合机制适时融合时域和频域信息。我们进一步构建了一个三阶段渐进式融合网络,使用 Group3M 块,其中模态互补注意力检索跨模态证据同时抑制冗余,多尺度卷积丰富特征表示。在 Rhythmic Gymnastics 和 Fis-V 数据集上进行的实验表明,PIDNet 在与现有单模态和多模态方法相比时,实现了高度具竞争力的得分相关性,同时控制误差良好。消融研究验证了每个组件的有效性。此外,iMambaWave 在多个 backbone 上 consistently 改善了视觉表征和时序建模,显示出良好的泛化性和即插即用能力。
引用
@article{arxiv.2605.08945,
title = {PIDNet: Progressive Implicit Decouple Network for Multimodal Action Quality Assessment},
author = {Qiqi Li and Pengfei Wang and Nenggan Zheng},
journal= {arXiv preprint arXiv:2605.08945},
year = {2026}
}
备注
14 pages, 6 figures, 11 tables