跨模态去噪:增强语音-图像检索的新型训练范式
计算与语言
2024-09-12 v2 声音
音频与语音处理
摘要
语音-图像检索的成功依赖于在语音和图像之间建立有效的对齐。现有方法通常通过对每种模态的全局特征进行简单余弦相似度建模来建模跨模态交互,这在捕捉模态内部细粒度细节方面不足。为此,我们引入一种有效框架和一种名为跨模态去噪(CMD)的新型学习任务,以增强跨模态交互以实现更细粒度的跨模态对齐。具体而言,CMD是一种去噪任务,旨在通过与另一模态的特征相互作用,从噪声特征中重建语义特征。值得注意的是,CMD仅在模型训练期间 operate,在推理期间可以移除而不增加额外的推理时间。实验结果表明,我们的框架在Flickr8k数据集上在平均R@1上比最先进的方法提高了2.0%,在SpokenCOCO数据集上在平均R@1上提高了1.7%,分别适用于语音-图像检索任务。这些实验结果验证了我们框架的效率和有效性。
引用
@article{arxiv.2408.13705,
title = {Cross-Modal Denoising: A Novel Training Paradigm for Enhancing Speech-Image Retrieval},
author = {Lifeng Zhou and Yuke Li and Rui Deng and Yuting Yang and Haoqi Zhu},
journal= {arXiv preprint arXiv:2408.13705},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2408.13119