Mask4Former:用于4D全景分割的掩码Transformer
计算机视觉与模式识别
2024-04-12 v2
摘要
准确地随时间感知和跟踪实例对于自主智能体在动态环境中安全交互的决策过程至关重要。为此,我们针对LiDAR点云4D全景分割这一挑战性任务提出Mask4Former。Mask4Former是首个基于transformer的方法,将稀疏且不规则的3D点云序列的语义实例分割与跟踪统一到单一联合模型中。我们的模型直接预测语义实例及其时间关联,而不依赖于手工设计的非学习关联策略,如概率聚类或基于投票的中心预测。相反,Mask4Former引入了时空实例查询,其编码序列中每个语义轨迹片段的语义和几何属性。在深入研究中,我们发现促进空间紧凑的实例预测至关重要,因为时空实例查询倾向于合并多个语义相似但空间上相距较远的实例。为此,我们从时空实例查询回归6自由度(6-DOF)包围盒参数,将其作为辅助任务以促使空间紧凑预测。Mask4Former在SemanticKITTI测试集上以68.4 LSTQ的分数取得了新的最先进水平(state-of-the-art)。
引用
@article{arxiv.2309.16133,
title = {Mask4Former: Mask Transformer for 4D Panoptic Segmentation},
author = {Kadir Yilmaz and Jonas Schult and Alexey Nekrasov and Bastian Leibe},
journal= {arXiv preprint arXiv:2309.16133},
year = {2024}
}
备注
Renamed from MASK4D to Mask4Former. ICRA 2024. Project page: https://vision.rwth-aachen.de/Mask4Former