利用 GPS 与 NLP 自动数据策管为自动驾驶汽车视觉语言导航数据集生成指令-动作对
机器人学
2025-05-07 v1 计算机视觉与模式识别
机器学习
摘要
指令-动作(IA)数据对对于训练机器人系统,尤其是自动驾驶汽车(AVs),非常有价值,但让人工手动标注这些数据成本高昂且时间效率低下。本文探讨了利用移动应用全球定位系统(GPS)参考和自然语言处理(NLP)自动生成大量 IA 命令和响应的潜力,而无需人工生成或事后标记数据。在我们的试点数据收集中,通过驾驶到不同目的地并收集来自 GPS 应用的语音指令,我们展示了一种收集和分类多样化指令集的方法,并进一步辅以视频数据以形成完整的视觉-语言-动作三元组。我们提供了关于我们完全自动化的数据收集原型系统 ADVLAT-Engine 的详细信息。我们将收集到的 GPS 语音指令分为八种不同的类别,突出了可从免费移动应用中策管的各种命令和指代性。通过研究和探索使用 GPS 参考自动化生成 IA 数据对,在最小化成本的同时提高创建高质量 IA 数据集的速度和规模的潜力,可以为稳健的视觉-语言-动作(VLA)模型服务于视觉语言导航(VLN)和人机交互自主系统等任务铺平道路。
引用
@article{arxiv.2505.03174,
title = {Automated Data Curation Using GPS & NLP to Generate Instruction-Action Pairs for Autonomous Vehicle Vision-Language Navigation Datasets},
author = {Guillermo Roque and Erika Maquiling and Jose Giovanni Tapia Lopez and Ross Greer},
journal= {arXiv preprint arXiv:2505.03174},
year = {2025}
}