中文

用于文本监督语义分割的带多视图 SimCon 损失

计算机视觉与模式识别 2023-02-08 v1

摘要

仅依靠网络数据中的图像-文本对齐来学习分割图像,会因数据中的噪声导致次优性能。该噪声来源于关联文本与图像视觉内容不相关的样本。本文不单纯依赖噪声数据的对齐,提出一种称为 SimCon 的新损失函数,其利用模态内相似性来确定对齐的合适正样本集。此外,使用图像的多视图(合成生成)进行训练并将 SimCon 损失与之结合,使训练更鲁棒。该损失版本称为 MV-SimCon。实证结果表明,使用所提损失函数在零样本、文本监督语义分割上带来一致提升,并在 PASCAL VOC、PASCAL Context 和 MSCOCO 上分别以 +3.0%+3.0\%+3.3%+3.3\%+6.9%+6.9\% 优于当前最优(SOTA)。借助测试时增强,我们进一步将这些结果提升至 PASCAL VOC、PASCAL Context 和 MSCOCO 上的 58.7%58.7\%26.6%26.6\%33.3%33.3\%,创下新高。此外,使用所提损失函数可实现鲁棒训练与更快收敛。

关键词

引用

@article{arxiv.2302.03432,
  title  = {SimCon Loss with Multiple Views for Text Supervised Semantic Segmentation},
  author = {Yash Patel and Yusheng Xie and Yi Zhu and Srikar Appalaraju and R. Manmatha},
  journal= {arXiv preprint arXiv:2302.03432},
  year   = {2023}
}