中文

层次对齐增强的自适应 grounding 网络用于通用指代表达理解

计算机视觉与模式识别 2025-01-03 v1

摘要

本文针对通用指代表达理解(Generalized Referring Expression Comprehension, GREC)这一挑战性任务进行了研究。与聚焦单目标表达的经典指代表达理解(Referring Expression Comprehension, REC)不同,GREC 将范围扩展到更为实用的场景,涵盖无目标和多目标表达。现有 REC 方法在处理 GREC 中遇到的复杂情况时面临挑战,主要原因是其固定的输出形式以及多模态表征的局限性。为此,我们提出了一种用于 GREC 的层次对齐增强的自适应 grounding 网络(Hierarchical Alignment-enhanced Adaptive Grounding Network, HieA2G),其能够灵活处理各类指代表达。首先,提出了层次多模态语义对齐模块(Hierarchical Multi-modal Semantic Alignment, HMSA),以包含三级对齐,包括词-对象、短语-对象和文本-图像对齐。它实现了跨模态在多个层次的层次式交互,从而实现对复杂情形的全面且稳健的多模态理解,大幅提升了对复杂情形的 grounding 能力。随后,针对 GREC 中目标对象数量的变化,引入自适应 grounding 计数器(Adaptive Grounding Counter, AGC),以动态确定输出目标的数量。此外,在 AGC 中引入辅助对比损失,以通过拉近具有相同计数的多模态特征并推远不同计数的特征来增强对象计数能力。大量实验结果表明,HieA2G 在挑战性的 GREC 任务上实现了新的状态hof(SOTA)性能,并在其他 4 项任务中表现优异,包括 REC、短语 grounding、指代表达分割(Referring Expression Segmentation, RES)以及通用指代表达分割(Generalized Referring Expression Segmentation, GRES),显示出所提出 HieA2G 具备的卓越优势和广泛可适应性。

关键词

引用

@article{arxiv.2501.01416,
  title  = {Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension},
  author = {Yaxian Wang and Henghui Ding and Shuting He and Xudong Jiang and Bifan Wei and Jun Liu},
  journal= {arXiv preprint arXiv:2501.01416},
  year   = {2025}
}

备注

AAAI 2025