学习空间感知的语言与音频嵌入
声音
2024-11-27 v2 机器学习
音频与语音处理
摘要
人类能够根据不精确的自然语言描述想象一个声音场景。例如,听到“狮子的吼声从我身后传来!”这样的短语,很容易想象出相应的声学环境。要让机器拥有同等程度的理解力,机器必须知道狮子是什么(语义属性)、“身后”的概念是什么(空间属性),以及这些语言信息如何与声音的语义和空间属性对齐(从身后传来的吼声听起来是怎样的)。当前最先进的音频基础模型学习将音频场景与自然文本描述进行映射,但它们是在非空间音频和文本对上训练的,因此缺乏空间感知能力。相比之下,声音事件定位与检测模型仅限于识别固定数量的声音类别,并将声源定位到绝对位置(例如0.2米),而非使用自然语言描述的位置(例如“在我旁边”)。为了解决这些差距,我们提出了ELSA,一个使用多模态对比学习训练的空间感知音频与文本嵌入模型。ELSA支持非空间音频、空间音频以及描述声音空间和语义成分的开放词汇文本描述。为了训练ELSA:(a)我们对总计4738小时的三个开源音频数据集的音频和文本描述进行空间增强,(b)我们设计了一个编码器,利用对比学习来捕获非空间音频的语义,以及空间音频的语义和空间属性。ELSA在语义检索和3D声源定位方面均与最先进技术具有竞争力。具体而言,ELSA在音频到文本和文本到音频的平均R@1指标上比基线高出+2.8%,并在3D声源定位的平均绝对误差上比基线降低了11.6度。
引用
@article{arxiv.2409.11369,
title = {Learning Spatially-Aware Language and Audio Embeddings},
author = {Bhavika Devnani and Skyler Seto and Zakaria Aldeneh and Alessandro Toso and Elena Menyaylenko and Barry-John Theobald and Jonathan Sheaffer and Miguel Sarabia},
journal= {arXiv preprint arXiv:2409.11369},
year = {2024}
}
备注
26 pages, 7 figures, accepted at NeurIPS 2024