通过三模重建实现跨模3D检索性能提升
计算机视觉与模式识别
2025-04-03 v1
摘要
跨模3D检索是实现3D与文本之间双向检索的关键且具有挑战性的任务。当前方法主要依赖某一种3D表征(如点云),很少利用2D-3D一致性和互补关系,这限制了其性能。为填补这一空白,我们提出采用多视图图像和点云联合表征3D形状,实现三模对齐(即图像、点、文本),以提升跨模3D检索性能。值得注意的是,我们引入三模重建来提高编码器的泛化能力。给定点特征,我们在文本特征的指导下重建图像特征,反之亦然。通过对齐的点云和多视图图像特征,我们通过细粒度2D-3D融合将其聚合为多模嵌入,以增强几何和语义理解。鉴于当前数据集中许多3D形状和文本共享相似语义导致噪声显著,我们采用硬负载对比训练以强调更重要的硬负样本,生成鲁棒的判别性嵌入。大量实验表明,在Text2Shape数据集上,我们的方法在形状到文本和文本到形状检索任务中均显著优于以往的SOTA方法,提升幅度可观。
引用
@article{arxiv.2504.01476,
title = {Enhanced Cross-modal 3D Retrieval via Tri-modal Reconstruction},
author = {Junlong Ren and Hao Wang},
journal= {arXiv preprint arXiv:2504.01476},
year = {2025}
}
备注
ICME 2025