用于多媒体检索的 CLIP 多模态哈希
计算机视觉与模式识别
2024-10-11 v1
摘要
多模态哈希方法在多媒体检索中广泛应用,可以融合多源数据生成二进制哈希码。然而,单个背板网络的特征表达能力有限,且未在大规模无监督多模态数据上进行联合预训练,导致检索准确率较低。为解决此问题,我们提出一种新型 CLIP 多模态哈希 (CLIPMH) 方法。该方法采用 CLIP 框架提取文本和视觉特征,然后融合生成哈希码。由于对每个模态特征的增强,本方法在多模态哈希方法的检索性能上具有显著提升。实验表明,与当前无监督和监督多模态哈希方法相比,所提出的 CLIPMH 可显著提高性能(mAP 提升最高可达 8.38%)。
引用
@article{arxiv.2410.07783,
title = {CLIP Multi-modal Hashing for Multimedia Retrieval},
author = {Jian Zhu and Mingkai Sheng and Zhangmin Huang and Jingfei Chang and Jinling Jiang and Jian Long and Cheng Luo and Lei Liu},
journal= {arXiv preprint arXiv:2410.07783},
year = {2024}
}
备注
Accepted by 31st International Conference on MultiMedia Modeling (MMM2025)