中文

MADiff:基于运动感知Mamba扩散模型的以意识视频为导的手轨迹预测

计算机视觉与模式识别 2025-11-17 v2

摘要

通过意识视频理解人类意图和动作是通往具身人工智能的重要途径。作为意识视觉技术的一个分支,手轨迹预测在理解人类运动模式中发挥着关键作用,为延伸现实和机器人操纵等下游任务提供支持。然而,在仅依赖意识视频的情况下,捕捉与合理时序因果性相一致的高层次人类意图具有挑战性。这种困难在相机意识运动干扰和缺乏显式 affordance 标签指导手轨迹分布优化时尤为突出。本工作提出一种新颖的手轨迹预测方法,命名为MADiff,通过扩散模型预测未来手部关键点。我们提出的在潜空间中实现的去噪操作通过我们提出的运动感知Mamba实现,其中整合了摄像者的意识运动,以实现运动驱动的选择性扫描 (MDSS)。为在没有显式 affordance 监督的情况下辨识手部与场景之间的关系,我们利用基础模型融合视觉和语言特征,从视频片段中捕获高层次语义。广泛的实验在五个公开数据集上进行,采用现有和我们提出的新评估指标,结果表明MADiff在预测手部轨迹方面与最先进的基线方法相当,同时实现了实时性能。我们将在项目页面发布MADiff的代码和预训练模型:https://irmvlab.github.io/madiff.github.io。

关键词

引用

@article{arxiv.2409.02638,
  title  = {MADiff: Motion-Aware Mamba Diffusion Models for Hand Trajectory Prediction on Egocentric Videos},
  author = {Junyi Ma and Xieyuanli Chen and Wentao Bao and Jingyi Xu and Hesheng Wang},
  journal= {arXiv preprint arXiv:2409.02638},
  year   = {2025}
}

备注

Accepted to TPAMI 2025