Logo-VGR:面向开放世界Logo识别的视觉基础推理
计算机视觉与模式识别
2025-10-01 v1 机器学习
摘要
多模态大语言模型(MLLMs)的最新进展主要在通用基准上进行评估,而它们在特定领域场景(如智能产品审核)中的应用仍未得到充分探索。为填补这一空白,我们引入了一个开放世界Logo识别基准,这是产品审核中的一项核心挑战。传统的Logo识别方法依赖于记忆数万个品牌的表示——这在现实场景中是一种不切实际的方法——而我们提出的方法Logo-VGR,仅需一小部分品牌的监督即可泛化到大规模品牌识别。具体来说,我们将Logo识别重新定义为一个基于比较的任务,要求模型将产品图像与候选Logo进行匹配,而不是直接生成品牌标签。我们进一步观察到,现有模型倾向于通过记忆品牌分布来过拟合,而不是学习鲁棒的多模态推理,这导致在未见过的品牌上表现不佳。为克服这一局限,Logo-VGR引入了一种特定领域多模态推理的新范式:Logo感知基础注入领域知识,Logo引导的视觉基础推理增强了模型的推理能力。实验结果表明,Logo-VGR在OOD设置下比强基线高出近10个点,展示了卓越的泛化能力。
引用
@article{arxiv.2509.25811,
title = {Logo-VGR: Visual Grounded Reasoning for Open-world Logo Recognition},
author = {Zichen Liang and Jingjing Fei and Jie Wang and Zheming Yang and Changqing Li and Pei Wu and Minghui Qiu and Fei Yang and Xialei Liu},
journal= {arXiv preprint arXiv:2509.25811},
year = {2025}
}