CoSformer:利用Transformer检测协同显著目标
计算机视觉与模式识别
2022-09-23 v2
摘要
协同显著目标检测(CoSOD)旨在模拟人类视觉系统从一组相关图像中发现共同且显著的对象。近期方法通常开发复杂的基于深度学习的模型,大幅提升了CoSOD任务的性能。但仍有两个主要缺陷需进一步解决:1)次优的图像间关系建模;2)缺乏对图像间可分离性的考虑。在本文中,我们提出协同显著目标检测Transformer(CoSformer)网络,以从多幅图像中捕获显著与共同的视觉模式。通过利用Transformer架构,所提方法解决了输入顺序的影响并极大提升了CoSOD任务的稳定性。我们还引入了图像间可分离性的新概念。我们构建对比学习方案来建模图像间可分离性,并学习更具判别力的嵌入空间以区分真实共同对象与噪声对象。在三个具挑战性基准(即CoCA、CoSOD3k和Cosal2015)上的大量实验表明,我们的CoSformer优于前沿模型并达到新的SOTA。我们希望CoSformer能激励未来更多视觉协同分析任务的研究。
引用
@article{arxiv.2104.14729,
title = {CoSformer: Detecting Co-Salient Object with Transformers},
author = {Lv Tang and Bo Li},
journal= {arXiv preprint arXiv:2104.14729},
year = {2022}
}