GazeMoDiff:用于随机人体运动预测的视线引导扩散模型
计算机视觉与模式识别
2024-10-23 v2
摘要
人体运动预测对于许多虚拟现实和增强现实(VR/AR)应用(如碰撞避免和逼真虚拟人生成)非常重要。尽管已知人眼视线与身体运动密切相关,且在近期的 VR/AR 头显设备中易于获取,但现有方法仅从观测到的过去运动中合成身体运动。我们提出了 GazeMoDiff——一种新颖的视线引导去噪扩散模型,用于生成随机人体运动。该方法首先使用视线编码器和运动编码器分别提取视线和运动特征,然后采用图注意力网络融合这些特征,最后通过交叉注意力机制将视线-运动特征注入噪声预测网络,以逐步生成未来多种合理的人体运动。在 MoGAZE 和 GIMO 数据集上的大量实验表明,我们的方法在多模态最终位移误差方面大幅优于 state-of-the-art 方法(在 MoGaze 上提升 17.3%,在 GIMO 上提升 13.3%)。我们进一步进行了一项人类研究(N=21),验证了我们的方法生成的运动被认为比先前方法的运动更精确、更逼真。总而言之,这些结果揭示了眼视线中可用于随机人体运动预测的丰富信息内容,以及我们的方法在利用这些信息方面的有效性。
引用
@article{arxiv.2312.12090,
title = {GazeMoDiff: Gaze-guided Diffusion Model for Stochastic Human Motion Prediction},
author = {Haodong Yan and Zhiming Hu and Syn Schmitt and Andreas Bulling},
journal= {arXiv preprint arXiv:2312.12090},
year = {2024}
}
备注
Accepted at PG 2024. Link: https://zhiminghu.net/yan24_gazemodiff.html