中文

面向指称图像分割的语义感知动态定位与精炼

计算机视觉与模式识别 2023-03-14 v1

摘要

指称图像分割从语言描述中分割出图像区域。为了生成高质量掩码,现有方法通常采用基于 RNN 或堆叠注意力层的迭代学习方法来精炼视觉-语言特征。尽管这些方法复杂,但基于 RNN 的方法受限于特定的编码器选择,而基于注意力的方法增益有限。在本工作中,我们提出了一种简单而有效的替代方案,用于渐进式学习有判别力的多模态特征。我们方法的核心思想是利用一个持续更新的查询作为目标对象的表示,并在每次迭代中增强与查询强相关的多模态特征,同时削弱相关性较弱的特征。由于查询由语言特征初始化并随后由对象特征更新,我们的算法逐渐从以定位为中心转向以分割为中心。该策略能够通过迭代逐步恢复缺失的对象部分以及/或去除多余部分。与同类方法相比,我们的方法更具通用性——它可以直接插入已有方法中并持续带来改进。在 RefCOCO、RefCOCO+ 和 G-Ref 等具有挑战性数据集上的实验结果证明了其相对于最先进方法的优势。

关键词

引用

@article{arxiv.2303.06345,
  title  = {Semantics-Aware Dynamic Localization and Refinement for Referring Image Segmentation},
  author = {Zhao Yang and Jiaqi Wang and Yansong Tang and Kai Chen and Hengshuang Zhao and Philip H. S. Torr},
  journal= {arXiv preprint arXiv:2303.06345},
  year   = {2023}
}

备注

AAAI 2023. 11 pages. 7 figures