中文

VT-Refine:通过仿真精细调优实现基于视觉-触觉反馈的双手装配学习

机器人学 2025-10-21 v2 机器学习

摘要

人类在通过适应丰富触觉反馈方面卓越于双手装配任务,这一能力在机器人通过行为模仿实现时仍具挑战性,原因在于人类演示的次优性和有限多样性。本文提出了 VT-Refine,一种结合真实演示、高保真触觉仿真与强化学习的视觉-触觉策略学习框架,用于解决精确且接触密集型的双手装配。我们首先在少量同步的视觉与触觉输入上训练扩散策略。该策略随后被迁移到配备模拟触觉传感器的仿真数字孪生体上,并通过大规模强化学习进一步精细调优,以提升鲁棒性与泛化能力。为实现仿真到现实的精确迁移,我们利用高分辨率压电阻性触觉传感器,提供法向力信号,并可通过 GPU 加速仿真进行真实建模。实验结果表明,VT-Refine 在仿真与实际环境中均显著提升了装配性能,主要通过增加数据多样性并实现更有效的策略精细调优。我们的项目页面地址为 https://binghao-huang.github.io/vt_refine/。

关键词

引用

@article{arxiv.2510.14930,
  title  = {VT-Refine: Learning Bimanual Assembly with Visuo-Tactile Feedback via Simulation Fine-Tuning},
  author = {Binghao Huang and Jie Xu and Iretiayo Akinola and Wei Yang and Balakumar Sundaralingam and Rowland O'Flaherty and Dieter Fox and Xiaolong Wang and Arsalan Mousavian and Yu-Wei Chao and Yunzhu Li},
  journal= {arXiv preprint arXiv:2510.14930},
  year   = {2025}
}

备注

Accepted by 9th Conference on Robot Learning (CoRL 2025); Website: https://binghao-huang.github.io/vt_refine/