你可以自由表达:通过答案提取提升多模态大语言模型的细粒度视觉识别能力
计算机视觉与模式识别
2025-12-10 v2 计算与语言
摘要
尽管由于多模态大语言模型(MLLMs)的兴起,零样本视觉分类重新引起了人们的兴趣,但评估自回归模型的自由形式响应仍然是一个持续的挑战。大多数现有工作专注于纯语言任务,或者不考虑超过5个选项的多项选择题(MCQs),而这两者对于解决细粒度视觉分类(FGVC)中的任务都是关键能力,在FGVC中选项数量从数百到数千不等,且选项高度相关。此外,在这种高度多选项的MCQ设置中,如何将LLM的选项提取扩展到基于检索的问题尚不清楚,因为在这种情况下计算选项集上的概率计算成本很高。在这项工作中,我们研究了nlg2choice,一种简单的两阶段方法,它首先以最小的约束向MLLM提出一个开放式问题,然后使用纯文本约束解码来预测最可能的选项。在检索设置中,我们使用一种早停方法来计算约束响应选择该选项的概率,以显著提高吞吐量。我们的结果显示,在七个细粒度视觉数据集的分类和检索评估中,性能均有提升,并且这种性能在LLM用户可以用自然语言实现任务的各种方式中都能保持。
引用
@article{arxiv.2510.14885,
title = {You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction},
author = {Logan Lawrence and Oindrila Saha and Megan Wei and Chen Sun and Subhransu Maji and Grant Van Horn},
journal= {arXiv preprint arXiv:2510.14885},
year = {2025}
}
备注
Accepted to WACV26. 12 pages, 8 tables, 5 figures