中文

GMT:用于3D场景中6自由度物体轨迹综合的目标条件多模态Transformer

计算机视觉与模式识别 2026-03-19 v1 机器人学

摘要

在3D环境中合成可控的6自由度物体操控轨迹对于使机器人与复杂场景交互至关重要,但由于需要精确的空间推理、物理可行性以及多模态场景理解,仍面临挑战。现有方法常依赖2D或部分3D表示,限制了其捕捉完整场景几何的能力,并约束了轨迹精度。我们提出了GMT(Goal-Conditioned Multimodal Transformer),一种多模态Transformer框架,通过联合利用3D包围盒几何、点云上下文、语义物体类别以及目标终端姿态,生成逼真且目标导向的物体轨迹。该模型将轨迹表示为连续的6自由度姿态序列,并采用量身定制的条件化策略融合几何、语义、上下文及目标导向信息。大量在合成数据和真实世界基准上的实验表明,GMT在空间精度和姿态控制方面超越了CHOIS和GIMO等最新人类动作和人体-物体交互基线,实现了显著提升。我们的方法为基于学习的操控规划建立了新的基准,并在多样化物体和杂乱3D环境中展现出强大的泛化能力。项目页面:https://huajian-zeng.github.io/projects/gmt/。

关键词

引用

@article{arxiv.2603.17993,
  title  = {GMT: Goal-Conditioned Multimodal Transformer for 6-DOF Object Trajectory Synthesis in 3D Scenes},
  author = {Huajian Zeng and Abhishek Saroha and Daniel Cremers and Xi Wang},
  journal= {arXiv preprint arXiv:2603.17993},
  year   = {2026}
}

备注

Accpeted by 3DV 2026. Project Page: https://huajian-zeng.github.io/projects/gmt/