EggHand:面向 egocentric 手姿预测的多模态基础模型
计算机视觉与模式识别
2026-05-11 v1
摘要
从 egocentric 视频预测未来 3D 手姿序列是理解人类意图并实现 AR/VR 辅助和人机交互的关键任务。然而,该任务仍然高度具有挑战性,因为 egocentric 手势运动受复杂人类意图驱动,具有高度灵活的关节配合,并且在由 ego-motion 引起的剧烈视角变化下观察。在本工作中,我们引入 EggHand,一个以 foundation-model 为基础的框架,用于 egocentric 手姿预测,通过统一多模态语义推理与动态运动建模。我们的ethods 将来自视觉语言动作 (VLA) 模型的动作解码器,捕获手势运动的结构化时序动态,与提供视角感知情境信息的 egocentric 视频文本编码器相结合,这些信息从大规模 first-person 视频中学习。这些组件克服了通用视觉编码器在 ego-motion 下的脆弱性,使其能够在运动、情境和高层意图之间进行联合推理,而无需依赖身体姿态或外部跟踪。在 EgoExo4D 数据集上的实验表明,EggHand 在预测准确性方面达到新的 state of the art,能够在严重的 ego-motion 下保持稳健性,并且进一步通过语言基任务提示实现可控预测。项目页面:https://jyoun9.github.io/EggHand
引用
@article{arxiv.2605.07642,
title = {EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting},
author = {Jaeyoung Choi and Hyeondong Kim and Yujin Kim and Daehee Park},
journal= {arXiv preprint arXiv:2605.07642},
year = {2026}
}
备注
CVPR Findings 2026