ROADWork:用于学习识别、观察、分析和穿越工地区域的数据集与基准
计算机视觉与模式识别
2025-11-06 v3 机器人学
摘要
感知和自主导航穿越工地区域是一项具有挑战性且仍在探索中的问题。相关数据集极其稀缺。我们提出了 ROADWork 数据集,以学习识别、观察、分析和穿越工地区域。现有领先的基础模型在应用于工地区域时会失败。在我们的数据集上进行微调可显著提升工地区域内的感知和导航能力。通过 ROADWork 数据集,我们发现世界各地都有新的工地图像,其检测精度提升了 32.5%,且以更高的频率(提升 12.8 倍)被发现。开放词汇方法同样效果不佳,而微调后的检测器在性能上提升了 32.2 的平均精度(AP)。视觉语言模型(VLM)在描述工地区域时表现困难,但微调后性能显著提升(提升 36.7 的 SPICE 分数)。除微调外,我们还展示了简单技术的价值。视频标签传播提供了额外的提升(提升 2.6 的 AP)用于实例分割。阅读工地标志时,通过裁剪缩放组合检测器和文本文字识别器可提升性能(提升 14.2% 的 1-NED)。将工地检测结果组合以提供上下文可进一步减少 VLM 中的幻觉现象(SPICE 提升 3.9)。我们预测导航目标并从工地视频中计算可驾驶路径。将道路施工语义纳入后,53.6% 的目标的角度误差(AE)< 0.5(提升 9.9%),75.3% 的路径的 AE < 0.5(提升 8.1%)。
引用
@article{arxiv.2406.07661,
title = {ROADWork: A Dataset and Benchmark for Learning to Recognize, Observe, Analyze and Drive Through Work Zones},
author = {Anurag Ghosh and Shen Zheng and Robert Tamburo and Khiem Vuong and Juan Alvarez-Padilla and Hailiang Zhu and Michael Cardei and Nicholas Dunn and Christoph Mertz and Srinivasa G. Narasimhan},
journal= {arXiv preprint arXiv:2406.07661},
year = {2025}
}
备注
ICCV 2025 Accepted Paper