中文

AGILE3D:注意力引导的交互式多目标三维分割

计算机视觉与模式识别 2024-04-11 v4 人机交互

摘要

在交互式分割中,模型与用户协作勾勒三维点云中的感兴趣物体。在迭代过程中,模型将每个数据点分配给某物体(或背景),而用户纠正所得分割中的错误并将其反馈给模型。当前最佳实践将问题表述为二分类并逐个分割物体。模型期望用户提供正点击以指示被误分为背景的区域,以及负点击以指示被误分为物体的区域。顺序访问物体是低效的,因其忽视了物体间协同:给定物体的正点击按定义可作为邻近物体的负点击。此外,相邻物体间的直接竞争可加速其公共边界的识别。我们引入AGILE3D,一种高效的基于注意力的模型,其(1)支持同时分割多个三维物体,(2)以更少用户点击产生更准分割掩码,(3)提供更快推理。我们的核心思想是将用户点击编码为时空查询,并通过点击注意力模块实现点击查询之间及它们与三维场景间的显式交互。每次新增点击时,我们仅需运行轻量解码器以产生更新后的分割掩码。在四个不同三维点云数据集的实验中,AGILE3D确立了新的state-of-the-art。此外,我们也在真实用户研究的实际设置中验证了其实用性。

关键词

引用

@article{arxiv.2306.00977,
  title  = {AGILE3D: Attention Guided Interactive Multi-object 3D Segmentation},
  author = {Yuanwen Yue and Sabarinath Mahadevan and Jonas Schult and Francis Engelmann and Bastian Leibe and Konrad Schindler and Theodora Kontogianni},
  journal= {arXiv preprint arXiv:2306.00977},
  year   = {2024}
}

备注

ICLR 2024 camera-ready. Project page: https://ywyue.github.io/AGILE3D