ReMeREC:关系感知与多实体指代表达式理解
计算机视觉与模式识别
2025-07-24 v1 人工智能
计算与语言
摘要
指代表达式理解(Referring Expression Comprehension, REC)旨在基于自然语言描述定位图像中的特定实体或区域。现有方法虽能处理单实体定位,但往往忽略多实体场景中复杂的实体间关系,限制了其准确性与可靠性。此外,缺乏具有细粒度配对图文关系标注的高质量数据集阻碍了该领域的进一步发展。为应对这一挑战,我们首先构建了一个名为 ReMeX 的关系感知多实体 REC 数据集,其中包含详细的关系与文本标注。随后,我们提出 ReMeREC,一种联合利用视觉与文本线索以定位多个实体并建模其间关系的新框架。为解决语言中隐式实体边界导致的语义歧义,我们引入了文本自适应多实体感知器(Text-adaptive Multi-entity Perceptron, TMP),该模块能从细粒度文本线索中动态推断实体的数量与跨度,生成具有区分度的表示。此外,我们的实体间关系推理器(Entity Inter-relationship Reasoner, EIR)增强了关系推理与全局场景理解能力。为进一步提升对细粒度提示词的语言理解能力,我们还利用大语言模型构建了一个小规模辅助数据集 EntityText。在四个基准数据集上的实验表明,ReMeREC 在多实体定位与关系预测任务中达到了 SOTA 性能,大幅优于现有方法。
引用
@article{arxiv.2507.16877,
title = {ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension},
author = {Yizhi Hu and Zezhao Tian and Xingqun Qi and Chen Su and Bingkun Yang and Junhui Yin and Muyi Sun and Man Zhang and Zhenan Sun},
journal= {arXiv preprint arXiv:2507.16877},
year = {2025}
}
备注
15 pages, 7 figures