SCA3D:通过3D形状和标题配对数据增强提升跨模态3D检索
计算与语言
2025-10-14 v3
摘要
跨模态3D检索任务旨在实现文本描述与3D形状之间的相互匹配。这在自然语言与3D环境之间的交互中具有潜在价值,特别是在机器人和具身人工智能应用中。然而,3D数据的稀缺和昂贵限制了现有跨模态3D检索方法的性能。这些方法高度依赖于从有限数量的3D形状中提取的特征,导致在各种场景中表现出差异的泛化能力较差。为解决此挑战,我们引入SCA3D,这是一种用于跨模态3D检索的3D形状和标题在线数据增强方法。我们使用LLaVA模型创建组件库,为数据集中每个3D形状的每个分段部件添加标题。值得注意的是,这 facilitates the generation of大量新的3D-文本对,包含新的语义特征。我们采用inter和intra距离将各种组件对齐到新的3D形状中,确保组件不重叠且紧密匹配。进一步地,利用文本模板处理每个组件的标题并生成新的文本描述。此外,我们使用单模态编码器基于丰富的数据集提取3D形状和文本的嵌入。然后,我们使用地球运输距离(EMD)计算细粒度跨模态相似性,并通过对比学习增强跨模态匹配,实现文本和3D形状之间的双向检索。广泛的实验表明,SCA3D在Text2Shape数据集上优于以往方法,将Shape-to-Text RR@1分数从20.03提高到27.22,将Text-to-Shape RR@1分数从13.12提高到16.67。代码可在 https://github.com/3DAgentWorld/SCA3D 找到。
引用
@article{arxiv.2502.19127,
title = {Exploring the Generalizability of Factual Hallucination Mitigation via Enhancing Precise Knowledge Utilization},
author = {Siyuan Zhang and Yichi Zhang and Yinpeng Dong and Hang Su},
journal= {arXiv preprint arXiv:2502.19127},
year = {2025}
}
备注
33 pages, 17 figures, 21 tables, accepted by EMNLP 2025 as findings paper