从异我中心到自我中心视角的跨视角动作识别理解
计算机视觉与模式识别
2024-08-27 v3
摘要
理解自我中心视频中的动作识别已成为具有众多实际应用的重要研究课题。受限于自我中心数据收集的规模和难度,学习鲁棒的基于深度学习的动作识别模型仍十分困难。由于跨视角视频的差异,将大规模异我中心数据中学到的知识迁移至自我中心数据颇具挑战。本文提出一种新颖的跨视角动作识别学习方法(CVAR),可有效将知识从异我中心视角迁移至自我中心视角。首先,基于两视角间相机位置的分析,我们在 Transformer 的自注意力机制中引入一种新颖的基于几何的约束。接着,我们提出一种新的跨视角自注意力损失,在未经配对的跨视角数据上学习,以强制自注意力机制学习跨视角知识迁移。最后,为进一步提升跨视角学习方法的性能,我们给出了有效度量视频与注意力图相关性的指标。在标准自我中心动作识别基准(即 Charades-Ego、EPIC-Kitchens-55 和 EPIC-Kitchens-100)上的实验结果表明了本方法的有效性与最先进的性能。
引用
@article{arxiv.2305.15699,
title = {Cross-view Action Recognition Understanding From Exocentric to Egocentric Perspective},
author = {Thanh-Dat Truong and Khoa Luu},
journal= {arXiv preprint arXiv:2305.15699},
year = {2024}
}