中文

小目标的指代表达理解

计算机视觉与模式识别 2025-10-07 v1 人工智能

摘要

指代表达理解(REC)旨在定位由自然语言表达式描述的目标对象。近期在视觉语言学习方面的进展显著提升了REC任务的性能。然而,在实际应用中如自动驾驶等场景下,定位极小目标仍是一个巨大的挑战。为此,我们提出面向小目标的REC新方法。首先,本文引入小目标REC(SOREC)数据集,包含10万组指代表达与对应小目标边界框的配对,涵盖驾驶场景中的小目标。其次,我们提出渐进式迭代缩放适配器(PIZA),一种用于参数高效微调的适配器模块,使模型能够逐步放大并定位小目标。在一系列实验中,我们将PIZA应用到GroundingDINO上,证明其在SOREC数据集上显著提升了准确率。我们的数据集、代码和预训练模型均已公开于项目页面。

引用

@article{arxiv.2510.03701,
  title  = {Referring Expression Comprehension for Small Objects},
  author = {Kanoko Goto and Takumi Hirose and Mahiro Ukai and Shuhei Kurita and Nakamasa Inoue},
  journal= {arXiv preprint arXiv:2510.03701},
  year   = {2025}
}