LIHE:面向广义弱监督指代理解的语言实例分割超球-欧几里得框架
摘要
现有的弱监督指代理解(Weakly-Supervised Referring Expression Comprehension, WREC)方法虽然有效,但受限于一对一映射假设,难以处理现实场景中对应零或多个目标的表达式。为填补这一差距,我们提出了弱监督广义指代理解任务(Weakly-Supervised Generalized Referring Expression Comprehension, WGREC),这是一种更实用的范式,可处理目标数量可变的表达式。然而,将WREC扩展至WGREC存在两个根本性挑战:监督信号的模糊性,即弱图像级监督不足以训练模型推断正确的目标数量和身份;以及语义表示的坍缩,即标准欧几里得相似性将层次相关概念强制聚集到非判别性簇中,模糊了类别边界。为此,我们提出一种 novel WGREC框架,命名为语言实例分割超球-欧几里得(Linguistic Instance-Split Hyperbolic-Euclidean, LIHE),其 operate 于两个阶段。第一个阶段,Referential Decoupling,预测目标对象的数量并将复杂表达式分解为更简单的子表达式。第二个阶段,Referent Grounding,then 使用 HEMix——我们创新的混合相似性模块,将欧几里得接近性的精确对齐能力与超球几何的层次建模优势有效融合。这种混合方法有效防止了语义坍缩,同时保留了相关概念之间的细粒度区别。广泛的实验表明,LIHE 在 gRefCOCO 和 Ref-ZOM 上建立了第一个有效的弱监督 WGREC 基线,而 HEMix 在标准 REC 数据集上实现了持续的改进,[email protected] 最高提升2.5%。代码已公开于 https://anonymous.4open.science/r/LIHE。
引用
@article{arxiv.2511.12020,
title = {LIHE: Linguistic Instance-Split Hyperbolic-Euclidean Framework for Generalized Weakly-Supervised Referring Expression Comprehension},
author = {Xianglong Shi and Silin Cheng and Sirui Zhao and Yunhan Jiang and Enhong Chen and Yang Liu and Sebastien Ourselin},
journal= {arXiv preprint arXiv:2511.12020},
year = {2025}
}