URECA:独特区域描述任何内容
计算机视觉与模式识别
2025-04-08 v1 人工智能
摘要
区域级别的描述旨在为特定图像区域生成自然语言描述,同时凸显其区分性特征。然而,现有方法在跨多层次生成唯一描述方面存在困难,限制了其实际应用场景。为满足需求,即进行细致的区域级别理解,我们引入 URECA 数据集,这是一个大型数据集,专为多层次区域描述而设计。与先前数据集侧重于显著目标不同,URECA 数据集通过纳入多样化的目标、部件和背景元素,确保区域与描述之间实现唯一且一致的映射。其核心在于一个阶段性数据 curated 流程,其中每个阶段逐步细化区域选择和描述生成。通过在每个阶段利用多模态大语言模型(Multimodal Large Language Models, MLLMs),我们的流程能够产生具有更高准确性和语义多样性的独特且语境明确的描述。基于该数据集,我们提出 URECA,一种新型描述模型,旨在有效编码多层次区域。URECA 通过对现有 MLLMs 进行简单而有效的修改,保持位置和形状等关键空间属性,从而实现细粒度且语义丰富的区域描述。我们的做法引入了动态掩码建模和高分辨率掩码编码器,以增强描述的唯一性。实验表明,URECA 在 URECA 数据集上实现了最先进的性能,并在现有区域级别描述基准测试中表现出良好的泛化能力。
引用
@article{arxiv.2504.05305,
title = {URECA: Unique Region Caption Anything},
author = {Sangbeom Lim and Junwan Kim and Heeji Yoon and Jaewoo Jung and Seungryong Kim},
journal= {arXiv preprint arXiv:2504.05305},
year = {2025}
}
备注
Project page: https://cvlab-kaist.github.io/URECA Code: https://github.com/cvlab-kaist/URECA