中文

推理时的想象:合成手内视角以实现鲁棒的视觉运动策略推理

机器人学 2025-09-22 v1

摘要

来自不同视角的视觉观测会显著影响机器人操作中视觉运动策略的性能。其中,自我中心(手内)视角通常为精确控制提供关键信息。然而,在某些应用中,由于硬件限制、系统复杂性和成本,为机器人配备专用的手内摄像头可能面临挑战。在本工作中,我们提出赋予机器人想象力感知——使其能够在推理时从智能体视角“想象”出手内观测。我们通过新视角合成 (NVS) 实现这一点,利用以智能体与手内视角相机之间相对位姿为条件的微调扩散模型。具体而言,我们应用基于 LoRA 的微调,将预训练的 NVS 模型 (ZeroNVS) 适配到机器人操作领域。我们在仿真基准 (RoboMimic 和 MimicGen) 以及使用 Unitree Z1 机械臂进行草莓采摘任务的真实世界实验中评估了我们的方法。结果表明,合成的手内视角显著增强了策略推理,有效恢复了因缺乏真实手内摄像头而导致的性能下降。我们的方法为部署鲁棒的视觉运动策略提供了一种可扩展且轻量化的硬件解决方案,突出了具身智能体中想象力视觉推理的潜力。

关键词

引用

@article{arxiv.2509.15717,
  title  = {Imagination at Inference: Synthesizing In-Hand Views for Robust Visuomotor Policy Inference},
  author = {Haoran Ding and Anqing Duan and Zezhou Sun and Dezhen Song and Yoshihiko Nakamura},
  journal= {arXiv preprint arXiv:2509.15717},
  year   = {2025}
}

备注

Submitted to IEEE for possible publication, under review