中文

基于对比掩码自编码器的自监督哈希用于 2D 图像与 3D 点云跨模态检索

计算机视觉与模式识别 2024-08-13 v1

摘要

实现 2D 图像与 3D 点云数据之间的跨模态哈希是实际检索系统中日益关注的问题。直接将现有的跨模态方法应用于这一新任务,无法充分捕捉潜在的多模态语义,也无法有效弥合 2D 与 3D 之间的模态差距。为在不依赖人工标注的情况下解决这些问题,我们提出了基于对比掩码自编码器的自监督哈希(CMAH)方法,用于图像与点云数据之间的检索。我们首先对比 2D-3D 数据对,并将它们显式地约束到联合汉明空间中。这种对比学习过程确保了生成的哈希码具有鲁棒的区分能力,并有效减少了模态差距。此外,我们利用多模态自编码器增强模型对多模态语义的理解。通过完成掩码图像/点云数据建模任务,模型被鼓励捕捉更多局部线索。此外,所提出的多模态融合模块促进了不同模态之间的细粒度交互。在三个公开数据集上的广泛实验表明,所提出的 CMAH 显著优于所有基线方法。

关键词

引用

@article{arxiv.2408.05711,
  title  = {Contrastive masked auto-encoders based self-supervised hashing for 2D image and 3D point cloud cross-modal retrieval},
  author = {Rukai Wei and Heng Cui and Yu Liu and Yufeng Hou and Yanzhao Xie and Ke Zhou},
  journal= {arXiv preprint arXiv:2408.05711},
  year   = {2024}
}

备注

Accepted by ICME 2024