SignRAG:面向可扩展零样本道路标志识别的检索增强系统
计算机视觉与模式识别
2025-12-16 v1 人工智能
计算与语言
信息检索
机器人学
摘要
自动道路标志识别是智能交通系统的关键任务,但传统深度学习方法面临标志类别数量庞大以及难以构建完备标注数据集的挑战。本文提出了一种新颖的零样本识别框架,将检索增强生成(RAG)范式应用于解决这一挑战。我们的方法首先利用视觉语言模型(VLM)从输入图像生成标志的文本描述。该描述用于从参考设计的向量数据库中检索一组最相关的标志候选。随后,大语言模型(LLM)对检索到的候选进行推理以做出最终的细粒度识别。我们在俄亥俄州MUTCD的303个监管标志上验证了该方法。实验结果表明该框架的有效性,在理想参考图像上达到95.58%的准确率,在具有挑战性的真实道路数据上达到82.45%。本工作证明了基于RAG的架构可用于创建可扩展且准确的道路标志识别系统,无需任务特定训练。
引用
@article{arxiv.2512.12885,
title = {SignRAG: A Retrieval-Augmented System for Scalable Zero-Shot Road Sign Recognition},
author = {Minghao Zhu and Zhihao Zhang and Anmol Sidhu and Keith Redmill},
journal= {arXiv preprint arXiv:2512.12885},
year = {2025}
}
备注
Submitted to IV 2026