以手部轨迹为条件的以自我中心为导向的预测模型
计算机视觉与模式识别
2025-08-29 v2
摘要
在以自我中心为导向的场景中,预测下一行动及其视觉结果对于理解人类-物体交互和实现机器人规划至关重要。然而,现有方法未能联合建模这两个方面。视觉-语言-动作(VLA)模型专注于动作预测,但缺乏对动作如何影响视觉场景的显式建模;而视频预测模型在不以特定动作为条件的情况下生成未来帧,常导致结果不合情合理或情境不一致。为填补这一差距,我们提出一种统一的两阶段预测框架,在手部轨迹条件下联合建模动作和视觉未来。第一阶段进行连续状态建模,处理异构输入(视觉观察、语言和动作历史),显式预测未来手部轨迹。第二阶段引入因果交叉注意力机制,融合多模态线索,利用推断的动作信号指导基于图像的潜在扩散模型(LDM)进行逐帧未来视频生成。我们的 approach 是首个专为处理自我中心人类活动理解和机器人操作任务而设计的统一模型,提供即将发生的动作及其视觉后果的显式预测。在 Ego4D、BridgeData 和 RLBench 上的大规模实验表明,我们的方法在动作预测和未来视频合成方面均优于最先进的基线。
引用
@article{arxiv.2508.19852,
title = {Ego-centric Predictive Model Conditioned on Hand Trajectories},
author = {Binjie Zhang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2508.19852},
year = {2025}
}
备注
Code: github.com/showlab/Ego-PM