面向零样本 3D 理解的文本引导合成几何增强
计算机视觉与模式识别
2025-01-20 v2
摘要
零样本识别模型需要大量训练数据才能实现泛化。然而,在零样本 3D 分类中,收集 3D 数据和描述文本成本高昂且耗时,构成了与 2D 视觉相比的重大障碍。近期的生成模型在合成数据制造方面实现了前所未有的逼真度,最近的研究表明,使用生成数据作为训练数据的潜力巨大。于是自然产生了一个问题:生成模型生成的合成 3D 数据能否用于扩展有限的 3D 数据集?针对此问题,我们提出了一种 3D 数据集扩展方法,称为 Textguided Geometric Augmentation (TeGA)。TeGA 专为语言-图像-3D 预训练设计,实现了零样本 3D 分类的 SoTA,并使用生成的文本到 3D 模型来增强和扩展有限的 3D 数据集。具体而言,我们自动生成文本引导的合成 3D 数据,并引入一致性过滤策略以 Discard 语义和几何形状与文本不匹配的噪声样本。在将原始数据集扩大一倍的实验中,我们的方法在基线方法上实现了改进,零样本性能在 Objaverse-LVIS 上提升 3.0%,在 ScanObjectNN 上提升 4.6%,在 ModelNet40 上提升 8.7%。这些结果表明 TeGA 有效地弥合了 3D 数据差距,使即使在训练数据有限的情况下也能实现稳健的零样本 3D 分类,为零样本 3D 视觉应用铺平了道路。
引用
@article{arxiv.2501.09278,
title = {Text-guided Synthetic Geometric Augmentation for Zero-shot 3D Understanding},
author = {Kohei Torimi and Ryosuke Yamada and Daichi Otsuka and Kensho Hara and Yuki M. Asano and Hirokatsu Kataoka and Yoshimitsu Aoki},
journal= {arXiv preprint arXiv:2501.09278},
year = {2025}
}