HaHeAE:在扩展现实中学习人类手部和头部运动的通用联合表征
计算机视觉与模式识别
2025-05-19 v3
摘要
人类手部和头部运动是扩展现实(XR)中最普遍的输入模式,对广泛的应用至关重要。然而,先前在 XR 中进行手部和头部建模的工作仅探索了单一模态或聚焦于特定应用。我们提出了 HaHeAE - 一个用于学习 XR 中手部和头部运动通用联合表征的新型自监督方法。本方法的核心是一个自编码器(AE),使用基于图卷积网络的语义编码器和基于扩散模型的随机编码器来学习手部-头部运动的联合语义和随机表征。它还包含一个基于扩散模型的解码器来重建原始信号。在三个公开 XR 数据集上的大规模评估表明,我们的方法 1) 在恢复质量方面显著优于常用自监督方法,最高提升74.0%,且在用户、活动和 XR 环境之间具有通用性;2) 启用了新应用,包括可解释的手部-头部簇识别和可变手部-头部运动生成;3) 可作为有效的特征提取器用于下游任务。这些结果共同表明了本方法的有效性,凸显了自监督方法在扩展现实中联合建模手部-头部行为的潜力。
引用
@article{arxiv.2410.16430,
title = {HaHeAE: Learning Generalisable Joint Representations of Human Hand and Head Movements in Extended Reality},
author = {Zhiming Hu and Guanhua Zhang and Zheming Yin and Daniel Haeufle and Syn Schmitt and Andreas Bulling},
journal= {arXiv preprint arXiv:2410.16430},
year = {2025}
}
备注
Link: https://zhiminghu.net/hu25_haheae