中文

从运输视角重新审视深度音频-文本检索

音频与语音处理 2024-05-17 v1 人工智能 声音

摘要

Learning-to-match(LTM)框架证明是有效的逆最优传输方法,用于学习两个数据源之间的底层度量,从而促进后续匹配。然而,传统 LTM 框架面临可扩展性挑战,每次更新底层度量参数时都需要使用整个数据集。在将 LTM 适用于深度学习情境时,我们引入了用于音频-文本检索问题的 mini-batch Learning-to-match(m-LTM)框架。该框架利用 mini-batch 子采样和马哈拉比斯增强型底层度量族。此外,为应对实际中的 misaligned 训练数据,我们提出了一种变体,利用部分最优传输来缓解训练数据中 misaligned 数据对的损害。我们在三个数据集上进行大量实验:AudioCaps、Clotho 和 ESC-50。结果表明,我们提出的方法能够学习丰富且富有表现力的联合嵌入空间,实现 SOTA 性能。更进一步,提出的 m-LTM 框架能够跨越音频和文本嵌入之间的模态鸿沟,超越三元组和对比损失,在 ESC-50 数据集上的零样本声音事件检测任务中取得更好表现。值得注意的是,在 AudioCaps 数据集上,利用 m-LTM 实现的部分最优传输在训练数据噪声比率变化的情况下,对对比损失表现出更好的噪声容忍性。我们的代码已公开于 https://github.com/v-manhlt3/m-LTM-Audio-Text-Retrieval。

关键词

引用

@article{arxiv.2405.10084,
  title  = {Revisiting Deep Audio-Text Retrieval Through the Lens of Transportation},
  author = {Manh Luong and Khai Nguyen and Nhat Ho and Reza Haf and Dinh Phung and Lizhen Qu},
  journal= {arXiv preprint arXiv:2405.10084},
  year   = {2024}
}