中文

跨域多步骤推理:野外零样态细粒度交通标志识别

计算机视觉与模式识别 2025-07-24 v2 人工智能 多媒体

摘要

本研究提出了跨域多步骤推理(Cross-domain Multi-step Thinking, CdMT)以提高野外零样态细粒度交通标志识别(Traffic Sign Recognition, TSR)性能。野外零样态细粒度TSR具有跨域问题,即干净模板交通标志与真实世界对应物之间的差异,且现有方法在跨国TSR场景中尤为困难,因为不同国家的交通标志往往不同。所提出的CdMT框架通过利用大型多模态模型(Large Multimodal Models, LMMs)的多步骤推理能力来应对这些挑战。我们引入情境描述、特征描述和差异描述,以设计多种思考过程。经过中心坐标提示优化的情境描述,使我们能够精确定位复杂道路图像中的目标交通标志,并通过新颖的先验交通标志假设过滤无关响应。源于模板交通标志的情境学习的特征描述,桥接跨域差距并增强细粒度TSR。差异描述通过区分相似标志中的细微差别来提升LMMs的多模态推理能力。CdMT独立于训练数据,仅需简单且一致的指令,从而实现跨国TSR。我们在三个基准数据集和两个来自不同国家的真实世界数据集上进行了广泛实验。所提出的CdMT框架在所有五个数据集上均优于其他最新方法,分别在GTSRB、BTSD、TT-100K、Sapporo和Yokohama数据集上的识别准确率分别为0.93、0.89、0.97、0.89和0.85。

关键词

引用

@article{arxiv.2409.01534,
  title  = {Cross-domain Multi-step Thinking: Zero-shot Fine-grained Traffic Sign Recognition in the Wild},
  author = {Yaozong Gan and Guang Li and Ren Togo and Keisuke Maeda and Takahiro Ogawa and Miki Haseyama},
  journal= {arXiv preprint arXiv:2409.01534},
  year   = {2025}
}

备注

Published by Knowledge-Based Systems