基于动画的数据增强方法用于不连续视频的动作识别
计算机视觉与模式识别
2024-10-14 v4
摘要
动作识别是计算机视觉的重要组成部分,在多个应用中发挥着关键作用。尽管卷积神经网络(CNNs)带来了显著改进,但当使用不连续视频帧训练时,这些模型性能下降,而这在现实场景中很常见。这种下降主要是由于时间连续性的丧失,而时间连续性对于理解人类动作的语义至关重要。为了克服这个问题,我们引入了4A(基于动作动画的增强方法)流程,该流程采用一系列复杂技术:从RGB视频的2D人体姿态估计开始,接着是基于四元数的图卷积网络用于关节方向和轨迹预测,以及动态骨骼插值用于使用游戏引擎技术创建更平滑、多样化的动作。这种创新方法在多种游戏环境中生成逼真的动画,并从多个视角观看。通过这种方式,我们的方法有效地弥合了虚拟与现实世界数据之间的领域差距。在实验评估中,4A流程在使用真实世界数据的传统训练方法中实现了相当甚至更优的性能,同时仅需要原始数据量的10%。此外,我们的方法在野外视频上表现出增强的性能,标志着动作识别领域的重大进步。
引用
@article{arxiv.2404.06741,
title = {An Animation-based Augmentation Approach for Action Recognition from Discontinuous Video},
author = {Xingyu Song and Zhan Li and Shi Chen and Xin-Qiang Cai and Kazuyuki Demachi},
journal= {arXiv preprint arXiv:2404.06741},
year = {2024}
}
备注
Accepted by ECAI24, model and code are available at https://github.com/xingyu-song/4A