多模态大语言模型时代下无词汇表的高效细粒度视觉识别
计算机视觉与模式识别
2025-05-05 v1 机器学习
摘要
细粒度视觉识别(FGVR)涉及区分相似的视觉类别,这在由于类别间细微差异以及需要大规模专家标注数据集这一固有难题下备受挑战。在医学影像等领域,由于隐私问题和高昂的标注成本,这类精心准备的数据集不可得。在缺乏标记数据的情况下,FGVR模型无法依赖预定义的训练标签,从而拥有无约束的预测输出空间。我们将此任务称为无词汇表细粒度视觉识别(VF-FGVR),即模型需在无先验标签信息的情况下,从无约束的输出空间中预测标签。虽然近期的多模态大语言模型(MLLM)在VF-FGVR方面显示出潜力,但对每个测试输入查询这些模型在成本和推理时间方面都不可行。为解决这些限制,我们提出了一种新方法——最近邻标签精炼(NeaR),通过使用MLLM生成的标签微调下游CLIP模型。该方法利用MLLM进行标签生成,从小规模无标签训练集构建弱监督数据集。NeaR旨在处理由MLLM生成标签所固有的噪声、随机性和开放性,并为高效的VF-FGVR建立了新的基准。
引用
@article{arxiv.2505.01064,
title = {Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs},
author = {Hari Chandana Kuchibhotla and Sai Srinivas Kancheti and Abbavaram Gowtham Reddy and Vineeth N Balasubramanian},
journal= {arXiv preprint arXiv:2505.01064},
year = {2025}
}
备注
preprint; earlier version accepted at NeurIPS 2024 Workshop on Adaptive Foundation Models