中文

估计的音频-标题对应关系提高基于语言的音频检索

音频与语音处理 2024-08-22 v1 机器学习 声音

摘要

双编码器音频检索系统通常基于匹配和不匹配的音频-标题对进行对比学习优化。这导致两个模态对应的项目在共享嵌入空间中彼此靠近。由于音频-标题数据集通常仅包含匹配的录音和描述,因此常见的做法是通过随机抽取标题来创建不匹配的对。这并不理想,因为随机抽取的标题可能仅凭运气就部分或完全描述该音频录音。然而,获取所有可能配对的对应关系信息代价高昂,通常不可获得;因此,我们建议用估计的对应关系来代替。为此,我们提出了两阶段训练程序:首先通常训练多个检索模型,即不使用估计的对应关系;在第二阶段,这些模型预测的音频-标题对应关系则作为预测目标。我们在ClothoV2和AudioCaps基准上进行评估,证明即使在限制性的自蒸馏设置下(即单个模型生成然后学习估计的对应关系),该方法仍能提高检索性能。我们进一步表明,该方法在ClothoV2基准上将mAP@10提升了1.6个百分点。

关键词

引用

@article{arxiv.2408.11641,
  title  = {Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval},
  author = {Paul Primus and Florian Schmid and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2408.11641},
  year   = {2024}
}

备注

In Proceedings of the 9th Workshop on Detection and Classification of Acoustic Scenes and Events, DCASE, Tokyo, Japan, 2024. Implementation available on GitHub: https://github.com/OptimusPrimus/salsa