ReMaX:通过松弛改进高效全景分割的训练
计算机视觉与模式识别
2023-07-03 v1
摘要
本文提出了一种新机制,以促进掩码Transformer(mask transformer)在高效全景分割训练中的使用,推动其部署的普及。我们观察到,由于其高度复杂性,全景分割的训练目标将不可避免地导致高得多的假阳性惩罚。这种不平衡的损失使得基于端到端掩码Transformer的架构的训练过程变得困难,尤其是对于高效模型。在本文中,我们提出ReMaX,在全景分割训练期间对掩码预测和类别预测添加松弛。我们证明,通过在训练期间使用这些简单的松弛技术,我们的模型可以在推理没有任何额外计算成本的情况下得到清晰且一致的提升。通过将我们的方法与MobileNetV3-Small等高效骨干网络相结合,我们的方法在COCO、ADE20K和Cityscapes上取得了高效全景分割的新最优(state-of-the-art)结果。代码和预训练检查点将在\url{https://github.com/google-research/deeplab2}提供。
关键词
引用
@article{arxiv.2306.17319,
title = {ReMaX: Relaxing for Better Training on Efficient Panoptic Segmentation},
author = {Shuyang Sun and Weijun Wang and Qihang Yu and Andrew Howard and Philip Torr and Liang-Chieh Chen},
journal= {arXiv preprint arXiv:2306.17319},
year = {2023}
}