doScenes:用于人类交互和视觉语言导航的具有自然语言指令的自动驾驶数据集
计算机视觉与模式识别
2024-12-10 v1 人工智能
摘要
人类交互式机器人系统,特别是自动驾驶车辆(AVs),必须有效地将人类指令集成到其运动规划中。本文介绍doScenes,一个旨在促进研究关于人类-车辆指令交互的新型数据集,关注直接影响车辆运动的短期指令。通过对多模态传感器数据进行自然语言指令和指代标签注释,doScenes在指令与驾驶响应之间架起了桥梁,使能够实现情境感知和自适应规划。与专注于排序或场景级推理的现有数据集不同,doScenes强调与静态和动态场景对象相关的可操作指令。该框架解决了先前研究的局限性,例如依赖模拟数据或预定义的动作集,支持在真实场景中细致和灵活的响应。本工作为开发无缝集成人类指令到自动系统的学习策略奠定了基础,推动了面向视觉语言导航的安全和有效的人车协作。我们在 https://www.github.com/rossgreer/doScenes 上公开数据。
引用
@article{arxiv.2412.05893,
title = {doScenes: An Autonomous Driving Dataset with Natural Language Instruction for Human Interaction and Vision-Language Navigation},
author = {Parthib Roy and Srinivasa Perisetla and Shashank Shriram and Harsha Krishnaswamy and Aryan Keskar and Ross Greer},
journal= {arXiv preprint arXiv:2412.05893},
year = {2024}
}