中文

类别分区VQ-VAE与潜在流匹配用于点云场景生成

计算机视觉与模式识别 2026-01-21 v1

摘要

大多数3D场景生成方法仅限于生成物体边界框参数,而较新的扩散方法也生成类别标签和潜在特征。利用物体尺寸或潜在特征,它们随后从预定义数据库中检索物体。对于包含多种、多类别物体的复杂场景,基于扩散的潜在特征无法被当前的自编码器有效解码为与目标类别一致的正确点云物体。我们引入了一个类别分区向量量化变分自编码器(CPVQ-VAE),它通过采用开创性的类别分区码本(其中码向量按类别标记)进行训练,以有效解码物体潜在特征。为了解决码本崩溃问题,我们提出了一种类别感知的运行平均更新方法,该方法在每个分区内重新初始化失效的码向量。在推理过程中,由专门为场景生成设计的潜在空间流匹配模型(LFMM)生成的物体特征和类别标签,被CPVQ-VAE使用。CPVQ-VAE的类别感知逆查找随后将生成的潜在特征映射到码本条目,这些条目被解码为特定类别的点云形状。因此,我们实现了纯点云生成,无需依赖外部物体数据库进行检索。大量实验表明,我们的方法能够可靠地恢复合理的点云场景,在复杂的客厅场景中,Chamfer误差和Point2Mesh误差分别降低了高达70.4%和72.3%。

关键词

引用

@article{arxiv.2601.12391,
  title  = {Class-Partitioned VQ-VAE and Latent Flow Matching for Point Cloud Scene Generation},
  author = {Dasith de Silva Edirimuni and Ajmal Saeed Mian},
  journal= {arXiv preprint arXiv:2601.12391},
  year   = {2026}
}

备注

Accepted to AAAI 2026, Main Technical Track