中文

面向细粒度识别的大型视觉语言模型:基准测试与优化策略

计算机视觉与模式识别 2025-12-12 v1 人工智能

摘要

大型视觉语言模型(Large Vision Language Models,简称 LVLMs)取得了显著进展,使其能够实现复杂的视觉语言交互和对话应用。然而,现有基准测试主要聚焦于推理任务,往往忽视细粒度识别这一关键环节,后者对于实际应用场景至关重要。为弥合这一差距,本文引入了细粒度识别开放世界基准测试(Fine-grained Recognition Open World,简称 FROW),旨在对 LVLMs 进行细致评估,采用 GPT-4o 进行测试。基于此,我们从“数据构建”和“训练过程”两个角度提出了一种新颖的优化策略,以提升 LVLMs 的性能。该数据集包括马赛克数据(将多个简答响应组合而成)和开放世界数据(基于真实问题与答案使用 GPT-4o 生成),构建了一个全面的框架,用于评估 LVLMs 在细粒度识别方面的表现。实验表明,马赛克数据可使类别识别准确率提升 1%,而开放世界数据可使 FROW 基准测试准确率提升 10%~20%,内容准确率提升 6%~12%。此外,将细粒度数据纳入预训练阶段可使模型的类别识别准确率提升最高可达 10%。该基准测试将在 https://github.com/pc-inno/FROW 公开。

关键词

引用

@article{arxiv.2512.10384,
  title  = {Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies},
  author = {Cong Pang and Hongtao Yu and Zixuan Chen and Lewei Lu and Xin Lou},
  journal= {arXiv preprint arXiv:2512.10384},
  year   = {2025}
}