通过对齐二维骨架序列与多模态融合的学习
计算机视觉与模式识别
2025-12-02 v7
摘要
本文提出一种自监督时间视频对齐框架,可用于若干细粒度人体活动理解应用。与直接以 3D 骨架坐标序列作为输入的先进方法 CASA 不同,我们的核心思想是使用 2D 骨架热图序列作为输入。不同于 CASA 仅在时间域执行自注意力,我们将 2D 骨架热图输入视频 transformer,该 transformer 在空间和时间域均执行自注意力以提取有效的时空与上下文特征。此外,我们引入基于 2D 骨架的简单热图增强技术用于自监督学习。尽管缺乏 3D 信息,我们的方法不仅比 CASA 取得更高精度,而且对缺失和噪声关键点具有更好鲁棒性。此外,在三个公开数据集(即 Penn Action、IKEA ASM 和 H2O)上的大量评估表明,我们的方法在不同细粒度人体活动理解任务中优于以往方法。最后,将 2D 骨架热图与 RGB 视频融合在所有指标和数据集上取得了最先进性能。据我们所知,我们的工作是首个利用 2D 骨架热图输入并首个探索多模态融合用于时间视频对齐的工作。我们的代码和数据集可在研究网站获取:https://retrocausal.ai/research/。
引用
@article{arxiv.2305.19480,
title = {Learning by Aligning 2D Skeleton Sequences and Multi-Modality Fusion},
author = {Quoc-Huy Tran and Muhammad Ahmed and Murad Popattia and M. Hassan Ahmed and Andrey Konin and M. Zeeshan Zia},
journal= {arXiv preprint arXiv:2305.19480},
year = {2025}
}
备注
Accepted to ECCV 2024