中文

TFANet: 用于鲁棒引用图像分割的三阶段图像-文本特征对齐网络

计算机视觉与模式识别 2025-09-17 v1 人工智能

摘要

引用图像分割(RIS)是一种根据语言表达式分割图像区域的任务,需要两个模态之间的细粒度对齐。然而,现有方法在多模态对齐和语言语义损失方面常常存在困难,尤其是在包含多个视觉相似对象的复杂场景中,其中唯一描述的目标经常被错误定位或分割不完整。为应对这些挑战,本文提出了 TFANet,一个三阶段图像-文本特征对齐网络,通过一个包含三个阶段的分层框架系统地增强多模态对齐:知识增强阶段(KPS)、知识融合阶段(KFS)和知识强化阶段(KIS)。在第一阶段,我们设计了多尺度线性交叉注意力模块(MLAM),它促进了视觉特征与文本表示在多个尺度之间的双向语义交换。这建立了图像区域与不同粒度的语言描述之间的丰富且高效的对齐。随后,KFS 通过跨模态特征扫描模块(CFSM)进一步增强特征对齐,该模块应用多模态选择性扫描来捕获长程依赖关系并构建统一的多模态表示。这对于建模长程跨模态依赖关系以及增强复杂场景中的对齐精度至关重要。最后,在 KIS 中,我们提出了词级语言特征引导语义深化模块(WFDM),以补偿前一阶段引入的语义退化。

关键词

引用

@article{arxiv.2509.13070,
  title  = {TFANet: Three-Stage Image-Text Feature Alignment Network for Robust Referring Image Segmentation},
  author = {Qianqi Lu and Yuxiang Xie and Jing Zhang and Shiwei Zou and Yan Chen and Xidao Luan},
  journal= {arXiv preprint arXiv:2509.13070},
  year   = {2025}
}