基于有向 Gromov-Wasserstein 差异的多视角动作识别
计算机视觉与模式识别
2024-05-03 v1
摘要
动作识别已成为计算机视觉中热门的研究课题之一。基于卷积网络和如 Transformer 的自注意力机制的各种方法解决了动作识别任务在空间和时间维度上的问题,并取得了具竞争力的性能。然而,这些方法无法保证模型所关注的动作主体的正确性,即如何确保动作识别模型聚焦于正确的动作主体以做出合理的动作预测。在本文中,我们提出了一种多视角注意力一致性方法,利用有向 Gromov-Wasserstein 差异计算来自动作视频两个不同视角的两个注意力之间的相似度。此外,我们的方法在单视角数据集上训练时,应用 Neural Radiance Field 的思想来隐式渲染新视角的特征。因此,本工作的贡献有三方面。首先,我们引入多视角注意力一致性以解决动作识别中合理预测的问题。其次,我们利用有向 Gromov-Wasserstein 差异定义了多视角一致注意力的新度量。第三,我们构建了一个基于 Video Transformers 和 Neural Radiance Fields 的动作识别模型。与近期的动作识别方法相比,所提出的方法在三个大规模数据集(即 Jester、Something-Something V2 和 Kinetics-400)上取得了 SOTA 结果。
引用
@article{arxiv.2405.01337,
title = {Multi-view Action Recognition via Directed Gromov-Wasserstein Discrepancy},
author = {Hoang-Quan Nguyen and Thanh-Dat Truong and Khoa Luu},
journal= {arXiv preprint arXiv:2405.01337},
year = {2024}
}