中文

基于跨域少样本情境学习的增强交通标志识别

计算机视觉与模式识别 2024-07-09 v1 人工智能 多媒体

摘要

最近出现的多模态大语言模型 (MLLM) 如 GPT-4o 和 GPT-4v 在自动驾驶领域展现出巨大的潜力。本文提出一种基于 MLLM 的跨域少样本情境学习方法,用于增强交通标志识别 (TSR)。我们首先构建一个基于 Vision Transformer Adapter 和提取模块的交通标志检测网络,用于从原始路面图像中提取交通标志。为减少对训练数据的依赖并提高跨国交通标志识别的性能稳定性,我们引入一种基于 MLLM 的跨域少样本情境学习方法。为增强 MLLM 对交通标志的精细识别能力,所提出的方法通过模板交通标志生成相应的描述文本。这些描述文本包含关于交通标志形状、颜色和组成的关键信息,可刺激 MLLM 对精细交通标志类别的感知能力。通过使用描述文本,我们的方法减少了模板交通标志与真实交通标志之间的跨域差异。该方法仅需简单且一致的文本指示,无需大规模的交通标志图像和标签。我们在德国交通标志识别基准数据集、比利时交通标志数据集以及两组来自日本的真实世界数据集上进行了全面评估。实验结果表明,该方法显著提升了 TSR 的性能。

关键词

引用

@article{arxiv.2407.05814,
  title  = {Cross-domain Few-shot In-context Learning for Enhancing Traffic Sign Recognition},
  author = {Yaozong Gan and Guang Li and Ren Togo and Keisuke Maeda and Takahiro Ogawa and Miki Haseyama},
  journal= {arXiv preprint arXiv:2407.05814},
  year   = {2024}
}