用于可扩展图像-文本和视频-文本检索的深度语义多模态哈希网络
计算机视觉与模式识别
2022-01-06 v3
摘要
哈希因其计算和存储效率而被广泛应用于大规模多媒体数据的多模态检索。在本文中,我们提出了一种新颖的深度语义多模态哈希网络(DSMHN),用于可扩展的图像-文本和视频-文本检索。所提出的深度哈希框架利用2D卷积神经网络(CNN)作为骨干网络来捕获图像-文本检索的空间信息,而3D CNN作为骨干网络来捕获视频-文本检索的空间和时间信息。在DSMHN中,通过显式保留模态间相似性和模态内语义标签,联合学习两组特定于模态的哈希函数。具体来说,假设学习到的哈希码应该对分类任务最优,两个流网络通过将语义标签嵌入到生成的哈希码上联合训练以学习哈希函数。此外,提出了一个统一的深度多模态哈希框架,通过同时利用特征表示学习、模态间相似性保持学习、语义标签保持学习和不同损失函数的哈希函数学习,来学习紧凑且高质量的哈希码。所提出的DSMHN方法是一个通用且可扩展的深度哈希框架,适用于图像-文本和视频-文本检索,可以灵活地与不同类型的损失函数集成。我们在四个广泛使用的多模态检索数据集上进行了广泛的单模态和跨模态检索任务实验。在图像-文本和视频-文本检索任务上的实验结果表明,DSMHN显著优于最先进的方法。
引用
@article{arxiv.1901.02662,
title = {Deep Semantic Multimodal Hashing Network for Scalable Image-Text and Video-Text Retrievals},
author = {Lu Jin and Zechao Li and Jinhui Tang},
journal= {arXiv preprint arXiv:1901.02662},
year = {2022}
}
备注
14 pages