中文

通过聚类学习像素级连续深度表示用于深度补全

计算机视觉与模式识别 2024-02-22 v1

摘要

深度补全是计算机视觉中长期存在的挑战,近年来基于分类的方法取得了巨大进展。然而,大多数现有的基于分类的方法依赖于预定义的像素共享且离散的深度值作为深度类别。这种表示法无法捕捉符合真实深度分布的连续深度值,导致边界区域出现深度涂抹现象。为了解决这个问题,我们从聚类的角度重新审视深度补全,并提出了一种名为 CluDe 的新型基于聚类的框架,专注于学习像素级和连续的深度表示。CluDe 的核心思想是在真实深度分布的驱动下,迭代地将像素共享且离散的深度表示更新为其对应的像素级和连续表示。具体而言,CluDe 首先利用深度值聚类学习一组深度中心作为深度表示。虽然这些深度中心是像素共享且离散的,但与预定义的深度类别相比,它们更符合真实的深度分布。然后,CluDe 估计这些深度中心的偏移量,使其能够沿深度分布的深度轴进行动态调整,从而生成像素级和连续的深度表示。大量实验表明,CluDe 通过利用像素级和连续深度表示,成功减少了物体边界周围的深度涂抹。此外,CluDe 在 VOID 数据集上实现了最先进(SOTA)的性能,并在 KITTI 数据集上优于基于分类的方法。

关键词

引用

@article{arxiv.2402.13579,
  title  = {Learning Pixel-wise Continuous Depth Representation via Clustering for Depth Completion},
  author = {Chen Shenglun and Zhang Hong and Ma XinZhu and Wang Zhihui and Li Haojie},
  journal= {arXiv preprint arXiv:2402.13579},
  year   = {2024}
}

备注

Published in IEEE TCSVT,15 pages,12 figures