机器人驱动的数据飞轮:为持续数据收集与基础模型适配在野外部署机器人
机器人学
2025-11-26 v1 人工智能
摘要
基础模型(FM)在视觉和语言领域已 unlocked 强大的零样本能力,但其对互联网预训练数据的依赖使其在非结构化、真实世界环境中变得脆弱。在部署期间遇到的混乱真实世界数据(例如被遮挡的文本或多语言文本)在现有语料库中严重不足。作为具身智能体的机器人,能够在物理环境中行动以收集大规模真实世界数据,为 FM 训练提供当前模型所缺失的精确示例。我们引入机器人驱动的数据飞轮(Robot-Powered Data Flywheel)框架,将机器人从 FM 的消费者转变为数据生成器。通过在野外部署配备 FM 的机器人,我们实现了一个良性循环:机器人执行有用任务的同时收集真实世界数据,以改进特定领域的适应性和相邻领域的泛化。我们以 Scanford 为该框架的实例,这是一个在东亚图书馆部署两周的移动操作机器人。Scanford 自主扫描书架,利用视觉语言模型(VLM)识别书籍,并利用图书目录为图像标注,而无需人工标注。该部署既有助于图书馆员,也产生了用于微调底层 VLM 的数据集,提高了该模型在野外图书馆场景中的性能以及在相邻领域的多语言 OCR 基准测试中的表现。通过收集 2103 本书架的数据,Scanford 将 VLM 在书籍识别上的性能从 32.0% 提升至 71.8%,将域外多语言 OCR 性能从 24.8% 提升至 46.6%(英文)和 30.8% 提升至 38.0%(中文),同时节省了约 18.7 小时的人力成本。这些结果凸显了机器人驱动的数据飞轮如何在实际部署中减少人力成本,并为持续适应现实世界的混乱性提供了新的路径。更多细节请参见:https://scanford-robot.github.io
引用
@article{arxiv.2511.19647,
title = {Robot-Powered Data Flywheels: Deploying Robots in the Wild for Continual Data Collection and Foundation Model Adaptation},
author = {Jennifer Grannen and Michelle Pan and Kenneth Llontop and Cherie Ho and Mark Zolotas and Jeannette Bohg and Dorsa Sadigh},
journal= {arXiv preprint arXiv:2511.19647},
year = {2025}
}