在无真实人类的情况下学习人体动作识别表征
计算机视觉与模式识别
2023-11-13 v1
摘要
在大规模视频数据集上预训练已成为在较小下游数据集上实现高动作识别性能的必要条件。然而,大多数大规模视频数据集包含人物图像,因此伴随隐私、伦理和数据保护相关问题,常阻碍其公开共享以用于可复现研究。现有工作试图通过模糊人脸、下采样视频或在合成数据上训练来缓解这些问题。另一方面,关于隐私保护预训练模型向下游任务可迁移性的分析十分有限。在本文中,我们通过首先提出问题来研究该问题:我们能否使用不包含真实人类的数据预训练人体动作识别模型?为此,我们首次提出一个基准,利用移除人类的真实世界视频和包含虚拟人类的合成数据来预训练模型。然后我们评估在该数据上学习到的表征向一组多样化下游动作识别基准的可迁移性。此外,我们提出一种新颖的预训练策略,称为隐私保护 MAE-Align,以有效结合合成数据与去人类真实数据。我们的方法比先前基线高出至多 5%,并在线性探测和微调两种设置下缩小了人体与无人体动作识别表征在下游任务上的性能差距。我们的基准、代码和模型可在 https://github.com/howardzh01/PPMA 获取。
引用
@article{arxiv.2311.06231,
title = {Learning Human Action Recognition Representations Without Real Humans},
author = {Howard Zhong and Samarth Mishra and Donghyun Kim and SouYoung Jin and Rameswar Panda and Hilde Kuehne and Leonid Karlinsky and Venkatesh Saligrama and Aude Oliva and Rogerio Feris},
journal= {arXiv preprint arXiv:2311.06231},
year = {2023}
}
备注
19 pages, 7 figures, 2023 NeurIPS Datasets and Benchmarks Track