中文

基于层次化核心集选择的复杂大场景理解

计算机视觉与模式识别 2025-10-21 v2

摘要

场景理解是计算机视觉中的核心任务,旨在从图像中提取语义信息,以识别对象、场景类别及其相互关系。尽管视觉语言模型(VLM)的发展推动了该领域的进步,但现有的VLM仍面临适应未见复杂大场景的挑战。为此,本文提出了一种层次化核心集选择(HCS)机制,以推动VLM在复杂大场景理解中的适应性。它基于所提出的理论保证重要性函数,逐步细化所选区域的选择,该函数考虑了效用、代表性、鲁棒性和协同作用。无需额外微调,HCS即可实现对未知场景的快速理解,无论其规模如何,同时通过最小可解释区域来缓解特征密度不足的问题。HCS是一种即插即用的方法,与任何VLM兼容。实验结果表明,HCS在各种任务中实现了卓越的性能和通用性。

关键词

引用

@article{arxiv.2507.13061,
  title  = {Advancing Complex Wide-Area Scene Understanding with Hierarchical Coresets Selection},
  author = {Jingyao Wang and Yiming Chen and Lingyu Si and Changwen Zheng},
  journal= {arXiv preprint arXiv:2507.13061},
  year   = {2025}
}

备注

Accepted by ACMMM2025