DeLoRes:用于低资源音频表示学习的去相关潜在空间方法
声音
2022-06-28 v3 计算与语言
音频与语音处理
摘要
受计算机视觉中自监督学习近期进展的启发,本文提出 DeLoRes,一种新的通用音频表示学习方法。我们的主要目标是使网络在资源受限(数据与计算均受限)的环境下学习表征,并能很好地泛化至多样化的下游任务。受 Barlow Twins 目标函数启发,我们提出学习对输入音频样本失真保持不变、同时确保包含关于该样本非冗余信息的嵌入。为此,我们度量两个相同网络(输入为从音频文件中采样的一段音频的失真版本)输出间的互相关矩阵,并使其尽可能接近单位矩阵。我们使用大规模 AudioSet 数据集的小子集与 FSD50K 的组合进行自监督学习,并以少于最先进算法一半的参数完成学习。为评估,我们将这些学到的表征迁移至 9 个下游分类任务,包括语音、音乐与动物声音,并在不同评估设定下展示出有竞争力的结果。除简单直观外,我们的预训练算法因其构造的固有特性而易于计算,且不需要细致的实现细节来避免平凡或退化解。此外,我们对结果进行了消融研究,并将所有代码与预训练模型公开于 https://github.com/Speech-Lab-IITM/DeLoRes。
引用
@article{arxiv.2203.13628,
title = {DeLoRes: Decorrelating Latent Spaces for Low-Resource Audio Representation Learning},
author = {Sreyan Ghosh and Ashish Seth and and Deepak Mittal and Maneesh Singh and S. Umesh},
journal= {arXiv preprint arXiv:2203.13628},
year = {2022}
}
备注
Accepted to AAAI 2022 workshop on Self-supervised Learning for Audio and Speech Processing