中文

由跨模态相似度一致性驱动的多尺度匹配用于音频-文本检索

声音 2024-03-18 v1 信息检索 音频与语音处理

摘要

音频-文本检索(ATR)旨在给定音频片段检索相关文本描述(A2T),反之亦然(T2A),近期引起了广泛的研究关注。现有方法通常将每个模态的信息聚合为单一向量进行匹配,但这牺牲了局部细节,难以捕捉模态内和模态间的复杂关系。此外,当前的 ATR 数据集缺乏全面的对齐信息,简单的二元对比学习标签忽略了对样本间细粒度语义差异的度量。为了应对这些挑战,我们提出了一种新颖的 ATR 框架,从不同视角和更细的粒度全面捕捉多模态信息的匹配关系。具体而言,引入了一种细粒度对齐方法,通过从局部到全局的多尺度过程实现更注重细节的匹配,以捕捉精细的跨模态关系。此外,我们率先应用了跨模态相似度一致性,利用模态内相似度关系作为软监督以促进更复杂的对齐。大量实验验证了我们方法的有效性,在 AudioCaps 数据集上 R@1 指标至少超越先前方法 3.9%(T2A)/ 6.9%(A2T),在 Clotho 数据集上超越 2.9%(T2A)/ 5.4%(A2T)。

关键词

引用

@article{arxiv.2403.10146,
  title  = {Multiscale Matching Driven by Cross-Modal Similarity Consistency for Audio-Text Retrieval},
  author = {Qian Wang and Jia-Chen Gu and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2403.10146},
  year   = {2024}
}

备注

5 pages, accepted to ICASSP2024