中文

由粗到细的对齐实现更优的语音-图像检索

计算与语言 2024-09-12 v2 声音 音频与语音处理

摘要

在本文中,我们提出了一种新颖的语音-图像检索框架。我们利用语音-图像对比学习任务在粗粒度层面对齐语音和图像表示,并利用语音-图像匹配学习任务进一步细化细粒度的跨模态对齐。语音-图像对比和语音-图像匹配学习任务以统一的方式进行联合训练。为了优化学习过程,我们利用了一个嵌入队列,该队列有助于在语音-图像对比学习期间高效采样高质量且多样化的负样本表示。此外,它通过基于语音-图像对比任务中计算的对比相似度有效挖掘难负样本,增强了语音-图像匹配任务的学习。为了在噪声监督下进一步优化学习,我们将动量蒸馏纳入训练过程。实验结果表明,在两个用于语音-图像检索任务的基准数据集上,我们的框架在R@1指标上比最先进的方法高出4%以上。此外,如零样本实验所示,我们的框架表现出优异的泛化能力。

关键词

引用

@article{arxiv.2408.13119,
  title  = {Coarse-to-fine Alignment Makes Better Speech-image Retrieval},
  author = {Lifeng Zhou and Yuke Li},
  journal= {arXiv preprint arXiv:2408.13119},
  year   = {2024}
}