中文

COALA:用于学习语义丰富音频表示的协同对齐自编码器

机器学习 2020-07-09 v2 信息检索 音频与语音处理 机器学习

摘要

基于深度神经网络(DNNs)的音频表示学习已成为手工特征的一种替代方法。为获得高性能,DNNs 常需要大量标注数据,而这类数据难以获取且成本高昂。在本文中,我们提出一种学习音频表示的方法,将音频及其关联标签的学习潜表示对齐。对齐通过最大化音频与标签潜表示之间的一致性来实现,使用的是对比损失。结果是一个反映声音声学与语义特征的音频嵌入模型。我们评估了嵌入模型的质量,将其作为特征提取器在三个不同任务(即声音事件识别、音乐流派与乐器分类)上衡量性能,并探究该模型捕获了何种类型的特征。我们的结果令人鼓舞,在所涉及任务中有时与最先进(SOTA)水平相当,且我们用该方法生成的嵌入与某些声学描述符高度相关。

关键词

引用

@article{arxiv.2006.08386,
  title  = {COALA: Co-Aligned Autoencoders for Learning Semantically Enriched Audio Representations},
  author = {Xavier Favory and Konstantinos Drossos and Tuomas Virtanen and Xavier Serra},
  journal= {arXiv preprint arXiv:2006.08386},
  year   = {2020}
}

备注

8 pages, 1 figure, workshop on Self-supervision in Audio and Speech at the 37th International Conference on Machine Learning (ICML), 2020, Vienna, Austria