面向深度跨模态哈希的语义连贯知识蒸馏
机器学习
2025-10-14 v1 计算机视觉与模式识别
信息检索
摘要
近年来,深度监督跨模态哈希方法通过以自监督方式学习语义信息取得了显著成功。然而,它们仍然面临一个关键限制:多标签语义提取过程未能与原始多模态数据显式交互,使得学习到的表示级语义信息与异构多模态数据不兼容,从而阻碍了弥合模态差距的性能。为了解决这一限制,本文提出了一种新颖的语义连贯知识蒸馏方案,用于深度跨模态哈希,称为SODA。具体来说,多标签信息被引入作为一种新的文本模态,并重新表述为一组真实标签提示,像文本模态一样描述图像中呈现的语义。然后,设计了一个跨模态教师网络,以有效蒸馏图像和标签模态之间的跨模态语义特征,从而为图像模态学习一个良好映射的汉明空间。从某种意义上说,这种汉明空间可以被视为一种先验知识,用于指导跨模态学生网络的学习,并全面保留图像和文本模态之间的语义相似性。在两个基准数据集上的大量实验证明了我们的模型相对于最先进方法的优越性。
引用
@article{arxiv.2510.09664,
title = {Semantic-Cohesive Knowledge Distillation for Deep Cross-modal Hashing},
author = {Changchang Sun and Vickie Chen and Yan Yan},
journal= {arXiv preprint arXiv:2510.09664},
year = {2025}
}