中文

TALENT:面向指称图像分割的目标感知高效调优

计算机视觉与模式识别 2026-04-02 v1

摘要

指称图像分割旨在基于自然文本表达式对特定目标进行分割。最近,参数高效调优(PET)作为一种有前景的范式涌现。然而,现有PET方法常受制于视觉特征无法突出文本所指目标实例,而激活类别相关但无关的对象。我们对此问题进行分析并量化,称为`非目标激活'(non-target activation, NTA)问题。为此,我们提出一种新框架TALENT,用于PET-based RIS的目标感知高效调优。具体方法是,首先提出一种校正成本聚合器(Rectified Cost Aggregator, RCA)以高效聚合文本所指特征。然后,通过目标感知学习机制(Target-aware Learning Mechanism, TLM)校正`非目标激活'以实现准确的目标激活,包括情境成对一致性学习和以目标为中心的对比学习。前者使用句子级文本特征实现对所指对象的整体理解,并构建文本所指亲和力图以优化视觉特征的语义关联。后者进一步增强目标局部化,以发现distinct实例并抑制与其他无关对象的关联。两种目标共同有效地解决了`非目标激活'问题。广泛的评估显示,TALENT在各种指标上均优于现有方法(例如在G-Ref验证集上提升2.5%的mIoU)。我们的代码将在https://github.com/Kimsure/TALENT上发布。

关键词

引用

@article{arxiv.2604.00609,
  title  = {TALENT: Target-aware Efficient Tuning for Referring Image Segmentation},
  author = {Shuo Jin and Siyue Yu and Bingfeng Zhang and Chao Yao and Meiqin Liu and Jimin Xiao},
  journal= {arXiv preprint arXiv:2604.00609},
  year   = {2026}
}

备注

Accepted by CVPR26 Findings