中文

野外环境中的非模态真值与补全

计算机视觉与模式识别 2024-04-30 v2

摘要

本文研究了非模态图像分割:预测包含可见和不可见(被遮挡)部分的完整物体分割掩码。在先前的工作中,真实图像上的非模态分割真值通常由人工标注预测,因此具有主观性。相比之下,我们利用 3D 数据建立了一个自动流程,以确定真实图像中部分被遮挡物体的真实非模态掩码真值。该流程用于构建一个非模态补全评估基准 MP3D-Amodal,包含多种物体类别和标签。为了更好地处理野外环境中的非模态补全任务,我们探索了两种架构变体:一种两阶段模型,首先推断遮挡物,随后进行非模态掩码补全;另一种单阶段模型,利用 Stable Diffusion 的表示能力进行跨多类别的非模态分割。无需特殊技巧,我们的方法在涵盖多种物体的非模态分割数据集(包括 COCOA 和我们新的 MP3D-Amodal 数据集)上实现了新的最先进性能。数据集、模型和代码可在 https://www.robots.ox.ac.uk/~vgg/research/amodal/ 获取。

关键词

引用

@article{arxiv.2312.17247,
  title  = {Amodal Ground Truth and Completion in the Wild},
  author = {Guanqi Zhan and Chuanxia Zheng and Weidi Xie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2312.17247},
  year   = {2024}
}

备注

CVPR 2024