SCA3D:通过 3D 形状和标题配对数据增强提升跨模态 3D 检索
计算机视觉与模式识别
2025-02-27 v1
摘要
跨模态 3D 检索任务旨在实现文本描述与 3D 形状之间的相互匹配。这在机器人和具身人工智能应用中,尤其是自然语言与 3D 环境交互方面具有潜在价值。然而,3D 数据的稀缺和昂贵限制了现有跨模态 3D 检索方法的性能。这些方法高度依赖于有限数量 3D 形状所提取的特征,导致其在多样化场景中泛化能力较差。为解决这一挑战,我们提出了 SCA3D,这是一种用于跨模态 3D 检索的 3D 形状和标题在线数据增强方法。我们的方法使用 LLaVA 模型创建组件库,为数据集中每个 3D 形状的每个分段部件进行标注。值得注意的是,这 facilitates 生成大量包含新语义特征的新 3D-文本对。我们采用距离度量来对齐各种组件以构建新的 3D 形状,确保组件之间不重叠且紧密匹配。进一步地,我们利用文本模板处理每个组件的标题并生成新的文本描述。此外,我们使用单模态编码器基于丰富后的数据集提取 3D 形状和文本的嵌入表示。随后,我们使用地球移动距离(EMD)计算细粒度跨模态相似度,并通过对比学习增强跨模态匹配,实现文本与 3D 形状之间的双向检索。大量实验表明,SCA3D 在 Text2Shape 数据集上优于以往工作,将形状到文本 RR@1 分数从 20.03 提升至 27.22,将文本到形状 RR@1 分数从 13.12 提升至 16.67。代码可在 https://github.com/3DAgentWorld/SCA3D 查看。
引用
@article{arxiv.2502.19128,
title = {SCA3D: Enhancing Cross-modal 3D Retrieval via 3D Shape and Caption Paired Data Augmentation},
author = {Junlong Ren and Hao Wu and Hui Xiong and Hao Wang},
journal= {arXiv preprint arXiv:2502.19128},
year = {2025}
}
备注
ICRA 2025