基于语言的音频检索:采用收敛绑定层与对比损失
声音
2022-06-30 v1 计算与语言
信息检索
音频与语音处理
摘要
本文处理DCASE 2022中提出的新任务——基于语言的音频检索。首先,我们引入一种简单且可扩展的架构,将音频编码器与文本编码器绑定在一起。其次,我们展示使用该架构配合对比损失可使模型显著超越基线模型性能。最后,除具有极低的训练内存需求外,我们能够在无需微调的情况下直接使用预训练模型。我们测试了方法并表明,组合使用我们的方法可显著超越基线分数。
引用
@article{arxiv.2206.14659,
title = {Language-Based Audio Retrieval with Converging Tied Layers and Contrastive Loss},
author = {Andrew Koh and Eng Siong Chng},
journal= {arXiv preprint arXiv:2206.14659},
year = {2022}
}