中文

PanSR:一种用于全景分割的以目标为中心的 Mask Transformer

计算机视觉与模式识别 2024-12-17 v1

摘要

全景分割是计算机视觉中的一项基础任务,也是自动驾驶汽车感知的关键组成部分。近期基于 mask-transformer 的方法在标准基准测试上取得了令人瞩目的性能,但在处理小目标、拥挤场景以及存在大范围目标尺度变化的场景时面临重大挑战。我们指出了当前方法的几个根本性缺陷:(i) 查询提议生成过程偏向于较大的目标,导致较小的目标被遗漏;(ii) 初始定位良好的查询可能会漂移到其他目标上,导致漏检;(iii) 空间上分离良好的实例可能被合并为单个掩码,导致对场景的解释不一致且错误。为了解决这些问题,我们重新思考了网络的各个组件及其监督方式,并提出了一种新颖的全景分割方法 PanSR。PanSR 有效缓解了实例合并问题,增强了小目标检测能力,并提升了在拥挤场景下的性能,在极具挑战性的 LaRS 基准测试上较 SOTA 取得了显著的 +3.4 PQ 提升,同时在 Cityscapes 上达到了 SOTA 性能。代码和模型将公开发布于 https://github.com/lojzezust/PanSR。

关键词

引用

@article{arxiv.2412.10589,
  title  = {PanSR: An Object-Centric Mask Transformer for Panoptic Segmentation},
  author = {Lojze Žust and Matej Kristan},
  journal= {arXiv preprint arXiv:2412.10589},
  year   = {2024}
}

备注

8 pages, 9 figures