FT-HID:一个用于第一人称与第三人称人体交互分析的大规模 RGB-D 数据集
计算机视觉与模式识别
2022-09-22 v1
摘要
人体交互分析是人体运动分析的一个重要研究课题。已有研究或使用第一人称视觉(FPV)或使用第三人称视觉(TPV)进行分析。然而,这两种视觉的联合学习迄今很少受到关注。原因之一是缺乏涵盖 FPV 和 TPV 的合适数据集。此外,现有的 FPV 或 TPV 基准数据集存在若干局限,包括样本数量、参与受试者、交互类别和模态有限。在本工作中,我们贡献了一个大规模人体交互数据集,即 FT-HID 数据集。FT-HID 包含第一人称和第三人称视觉的成对对齐样本。该数据集采集自 109 名不同受试者,三种模态下拥有超过 90K 样本。我们使用多种现有动作识别方法对该数据集进行了验证。此外,我们提出了一种用于骨架序列的新颖多视角交互机制,以及一种用于第一人称和第三人称视觉的联合学习多流框架。两种方法在 FT-HID 数据集上均取得了有前景的结果。期望这一视觉对齐的大规模数据集的推出将推动 FPV 和 TPV 及其用于人体动作分析的联合学习技术的发展。数据集与代码可在 \href{https://github.com/ENDLICHERE/FT-HID}{here} 获取。
引用
@article{arxiv.2209.10155,
title = {FT-HID: A Large Scale RGB-D Dataset for First and Third Person Human Interaction Analysis},
author = {Zihui Guo and Yonghong Hou and Pichao Wang and Zhimin Gao and Mingliang Xu and Wanqing Li},
journal= {arXiv preprint arXiv:2209.10155},
year = {2022}
}