MobileEgo Anywhere:面向大尺度习惯性数据集的开放式基础设施
计算机视觉与模式识别
2026-05-20 v5 计算与语言
摘要
近期视觉语言动作(VLA)模型的发展推动了对大规模习惯性数据集的重要需求。然而,现有数据集常受限于短时段录制,通常仅持续几分钟,无法捕捉复杂机器人任务执行所需的长时序依赖关系。为弥合这一差距,我们提出MobileEgo Anywhere,一个旨在利用廉价移动硬件收集稳健、数小时习惯性轨迹的框架。我们利用现代智能手机普遍搭载的传感器套件,提供高保真的长期相机姿态跟踪,有效降低了传统机器人数据采集的高硬件门槛。我们的贡献有三点:(1)我们发布了一个新型数据集,包含200小时多样化、长时段习惯性数据,具备持久状态跟踪;(2)我们开源整个视频处理基础设施-STERA,使任何用户都能记录和处理习惯性数据;(3)我们提供完善的处理管道,将原始移动采集数据转换为面向视觉语言动作模型和基础模型研究的标准化、训练就绪格式。通过民主化数据采集过程,本工作实现了跨多样化全球环境的大规模长时序数据获取,加速了通用机器人策略的开发。数据集和代码可访问于 https://www.fpvlabs.ai/stera
引用
@article{arxiv.2605.05945,
title = {MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardware},
author = {Senthil Palanisamy and Abhishek Anand and Satpal Singh Rathor and Pratyush Patnaik and Shubhanshu Khatana and Ekaksh Janweja},
journal= {arXiv preprint arXiv:2605.05945},
year = {2026}
}