SORCE:复杂环境中的小目标检索
计算机视觉与模式识别
2025-06-02 v1
摘要
文本到图像检索(T2IR)是一项极具价值的任务,旨在将给定的文本查询与图库中的图像进行匹配。现有的基准主要关注描述整体图像语义或前景显著目标的文本查询,可能忽略了不显眼的小目标,尤其是在复杂环境中。这种小目标检索至关重要,因为在实际应用中,感兴趣的目标并不总是图像中的显著对象。因此,我们引入了 SORCE(复杂环境中的小目标检索),作为 T2IR 的一个新子领域,专注于用文本查询在复杂图像中检索小目标。我们提出了一个新的基准 SORCE-1K,由包含复杂环境的图像和描述不太显眼的小目标的文本查询组成,且这些目标具有来自其他显著目标的最少上下文线索。在 SORCE-1K 上的初步分析发现,现有的 T2IR 方法难以捕获小目标并将所有语义编码到单个嵌入中,导致在 SORCE-1K 上的检索性能不佳。因此,我们提出用多个独特的嵌入来表示每张图像。我们利用多模态大语言模型(MLLM)在一组区域提示的指示下为每张图像提取多个嵌入。实验结果表明,我们通过 MLLM 和 ReP 的多嵌入方法在 SORCE-1K 上显著优于现有的 T2IR 方法。我们的实验验证了 SORCE-1K 在评估 SORCE 性能方面的有效性,突出了多嵌入表示和文本定制 MLLM 特征在解决该任务中的潜力。
引用
@article{arxiv.2505.24441,
title = {SORCE: Small Object Retrieval in Complex Environments},
author = {Chunxu Liu and Chi Xie and Xiaxu Chen and Wei Li and Feng Zhu and Rui Zhao and Limin Wang},
journal= {arXiv preprint arXiv:2505.24441},
year = {2025}
}
备注
Project Page: https://github.com/MCG-NJU/SORCE