基于Transformer的视觉分割:综述
计算机视觉与模式识别
2024-08-06 v4
摘要
视觉分割旨在将图像、视频帧或点云划分为多个片段或组。该技术在自动驾驶、图像编辑、机器人传感和医学分析等许多现实世界应用中具有广泛用途。在过去十年中,基于深度学习的方法在该领域取得了显著进展。近来,Transformer——一种基于自注意力、最初为自然语言处理设计的神经网络——在各种视觉处理任务中大幅超越了先前的卷积或循环方法。具体而言,视觉Transformer为各种分割任务提供了鲁棒、统一甚至更简洁的解决方案。本综述提供了基于Transformer的视觉分割的全面概览,总结了近期进展。我们首先回顾背景,包括问题定义、数据集和先前的卷积方法。接下来,我们总结了一个统一所有近期基于Transformer方法的元架构。基于此元架构,我们考察了各种方法设计,包括对元架构的修改及相关应用。我们还介绍了几个紧密相关的设定,包括3D点云分割、基础模型微调、域感知分割、高效分割和医学分割。此外,我们在多个成熟数据集上重新编译并评估了所综述的方法。最后,我们指出了该领域的开放挑战并提出了未来研究方向。项目页面见 https://github.com/lxtGH/Awesome-Segmentation-With-Transformer。我们也将持续关注这一快速发展领域的进展。
引用
@article{arxiv.2304.09854,
title = {Transformer-Based Visual Segmentation: A Survey},
author = {Xiangtai Li and Henghui Ding and Haobo Yuan and Wenwei Zhang and Jiangmiao Pang and Guangliang Cheng and Kai Chen and Ziwei Liu and Chen Change Loy},
journal= {arXiv preprint arXiv:2304.09854},
year = {2024}
}
备注
Accepted by IEEE T-PAMI. Project page: https://github.com/lxtGH/Awesome-Segmentation-With-Transformer