IIR-VLM:面向大型视觉-语言模型的上下文实例级识别
计算机视觉与模式识别
2026-01-21 v1
摘要
实例级识别 (ILR) 关注区分彼此不同的个体实例,行人重识别是一个突出的例子。尽管现代 VLM 具有令人印象深刻的视觉感知能力,但我们发现它们在 ILR 上的表现不尽人意,通常显著逊色于特定领域的 ILR 模型。这一局限性阻碍了 VLM 的许多实际应用,例如,在识别熟悉的人和物体对于有效视觉理解至关重要的场景中。现有解决方案通常使用特定实例的数据集一次学习识别一个实例,这不仅会产生大量的数据收集和训练成本,而且在细粒度判别方面也面临困难。在这项工作中,我们提出了 IIR-VLM,一个为上下文实例级识别而增强的 VLM。我们集成预训练的 ILR 专家模型作为辅助视觉编码器,为学习多样化实例提供专门的特征,这使 VLM 能够以单样本的方式在上下文中学习新实例。此外,IIR-VLM 利用这些知识进行实例感知的视觉理解。我们在现有的实例个性化基准上验证了 IIR-VLM 的有效性。最后,我们在一个具有挑战性的新基准上展示了其优越的 ILR 性能,该基准评估了跨不同难度和多样化类别的 ILR 能力,其中人物、人脸、宠物和通用物体作为任务中的实例。
引用
@article{arxiv.2601.14188,
title = {IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models},
author = {Liang Shi and Wei Li and Kevin M Beussman and Lin Chen and Yun Fu},
journal= {arXiv preprint arXiv:2601.14188},
year = {2026}
}