用于二分图像分割的多视图聚合网络
计算机视觉与模式识别
2024-04-12 v1
摘要
二分图像分割最近兴起,旨在从高分辨率自然图像中实现高精度目标分割。在设计有效的二分图像分割模型时,主要挑战是如何平衡高分辨率目标在小感受野中的语义分散性和大感受野中高精度细节的丢失。现有方法依赖于繁琐的多编码器-解码器流和多阶段来逐步完成全局定位和局部细化。人类视觉系统通过从多个视角观察来捕获感兴趣区域。受此启发,我们将二分图像分割建模为一个多视图目标感知问题,并提出一个简洁的多视图聚合网络,该网络将远视图和近视图的特征融合统一到一个具有单编码器-解码器结构的单流中。借助所提出的多视图互补定位和细化模块,我们的方法建立了跨多个视图的远程、深入的视觉交互,使得细节丰富的近视图特征能够聚焦于高度细长的结构。在流行的DIS-5K数据集上的实验表明,我们的多视图聚合网络在准确性和速度上都显著优于最先进的方法。源代码和数据集将在 \href{https://github.com/qianyu-dlut/MVANet}{MVANet} 公开提供。
引用
@article{arxiv.2404.07445,
title = {Multi-view Aggregation Network for Dichotomous Image Segmentation},
author = {Qian Yu and Xiaoqi Zhao and Youwei Pang and Lihe Zhang and Huchuan Lu},
journal= {arXiv preprint arXiv:2404.07445},
year = {2024}
}
备注
Accepted by CVPR2024 as Highlight