智能镜头实现的灵活性:基于野外人类演示的多指机器人操控
机器人学
2025-11-21 v1 人工智能
机器学习
摘要
从人类在自然环境中执行日常任务的方式中学习多指机器人策略,一直是机器人社区的终极目标之一。实现这一目标将显著推动通用机器人操控在人类环境中的可泛化化,因为它将减少对耗时的机器人数据收集的依赖。尽管已付出大量努力,但实现这一目标的进展一直受制于人机本体差距,以及从野外人类视频中提取相关情境和运动线索以学习自主策略的困难。我们认为,通过简单而功能足够强大的硬件获取人类数据以及我们提出的框架 AINA,现在我们正迈出了实现这一梦想的重要一步。AINA 允许任何人、任何地方、在任何环境中使用 Aria Gen 2 眼镜收集数据学习多指策略。这些眼镜轻便便携,配备高分辨率 RGB 摄像头,提供准确的 onboard 3D 头部和手部姿态,并提供宽阔的立体视野,可用于场景深度估计。该 setup 使得能够学习对背景变化鲁棒的基于 3D 点的多指手策略,可直接部署,不需任何机器人数据(包括在线纠正、强化学习或仿真)。我们将框架与先前的人类到机器人策略学习方法进行比较,对设计选择进行消融实验,并在九个日常操控任务上展示结果。机器人 rollout 最佳效果请访问我们的网站:https://aina-robot.github.io。
引用
@article{arxiv.2511.16661,
title = {Dexterity from Smart Lenses: Multi-Fingered Robot Manipulation with In-the-Wild Human Demonstrations},
author = {Irmak Guzey and Haozhi Qi and Julen Urain and Changhao Wang and Jessica Yin and Krishna Bodduluri and Mike Lambeta and Lerrel Pinto and Akshara Rai and Jitendra Malik and Tingfan Wu and Akash Sharma and Homanga Bharadhwaj},
journal= {arXiv preprint arXiv:2511.16661},
year = {2025}
}