用于三维双臂操作的大型预训练模型
计算机视觉与模式识别
2025-11-13 v1 机器学习
机器人学
摘要
我们研究了将预训练视觉 Transformer 的注意力图整合到体素表示中以增强双臂机器人操作。具体而言,我们从 DINOv2——一个自监督 ViT 模型——中提取注意力图,并将它们解释为 RGB 图像上的像素级显著性分数。这些图被提升到三维体素网格中,产生体素级语义线索,并被整合到行为克隆策略中。当整合到最先进的基于体素的策略中时,我们的注意力引导特征化在所有 RLBench 双臂基准任务上实现了平均绝对提升 8.2% 和相对提升 21.9%。
引用
@article{arxiv.2509.20579,
title = {Large Pre-Trained Models for Bimanual Manipulation in 3D},
author = {Hanna Yurchyk and Wei-Di Chang and Gregory Dudek and David Meger},
journal= {arXiv preprint arXiv:2509.20579},
year = {2025}
}
备注
Accepted to 2025 IEEE-RAS 24th International Conference on Humanoid Robots