多模态感知信息驱动的3D人体运动预测
计算机视觉与模式识别
2024-05-07 v1
摘要
预测人体姿态是机器智能的一个基本应用,驱动机器人提前规划行为与路径,以便在实际3D场景中无缝完成人机协作。尽管已有方法取得鼓舞人心的成果,但这些方法很少考虑外部场景对运动序列的影响,导致预测结果出现明显瑕疵且在物理上不可信。为此,本工作引入一种新型的多模态感知信息驱动运动预测方法,将外部3D场景信息与内部人体视线信息相结合,能够识别其对未来人体活动的显著性。进而,将视线信息视为人体意图,并与运动特征和场景特征相结合,构建三元意图感知注意力机制,以监督生成过程,使其吻合人体希望到达的目标位置。同时,引入语义一致性注意力机制,显式区分显著点云与底层点云,以确保生成序列与3D场景之间实现合理的交互。在两个真实世界基准数据集上,所提方法在3D人体姿态与轨迹预测方面均实现了最先进的性能。
引用
@article{arxiv.2405.02911,
title = {Multimodal Sense-Informed Prediction of 3D Human Motions},
author = {Zhenyu Lou and Qiongjie Cui and Haofan Wang and Xu Tang and Hong Zhou},
journal= {arXiv preprint arXiv:2405.02911},
year = {2024}
}