中文

基于语言的音频检索:采用收敛绑定层与对比损失

声音 2022-06-30 v1 计算与语言 信息检索 音频与语音处理

摘要

本文处理DCASE 2022中提出的新任务——基于语言的音频检索。首先,我们引入一种简单且可扩展的架构,将音频编码器与文本编码器绑定在一起。其次,我们展示使用该架构配合对比损失可使模型显著超越基线模型性能。最后,除具有极低的训练内存需求外,我们能够在无需微调的情况下直接使用预训练模型。我们测试了方法并表明,组合使用我们的方法可显著超越基线分数。

关键词

引用

@article{arxiv.2206.14659,
  title  = {Language-Based Audio Retrieval with Converging Tied Layers and Contrastive Loss},
  author = {Andrew Koh and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2206.14659},
  year   = {2022}
}