用于指代图像分割的全面多模态交互
计算机视觉与模式识别
2022-08-16 v4
摘要
我们研究指代图像分割(RIS),其输出与自然语言描述相对应的分割图。高效地处理RIS需要考虑跨视觉与语言模态发生的交互以及各模态内部的交互。现有方法的局限性在于它们要么顺序地计算不同形式的交互(导致误差传播),要么忽略模态内交互。我们通过同步多模态融合模块(SFM)同时执行全部三种交互来解决这一局限。此外,为生成精细的分割掩码,我们提出了一种新颖的层级跨模态聚合模块(HCAM),其中语言特征促进了跨视觉层级上下文信息的交换。我们给出了充分的消融研究,并在四个基准数据集上验证了方法的性能,显示出相较现有最优(SOTA)方法的显著性能提升。
引用
@article{arxiv.2104.10412,
title = {Comprehensive Multi-Modal Interactions for Referring Image Segmentation},
author = {Kanishk Jain and Vineet Gandhi},
journal= {arXiv preprint arXiv:2104.10412},
year = {2022}
}
备注
Findings of ACL 2022