SPADE:用于声学解耦的自监督预训练
机器学习
2023-02-06 v1 声音
音频与语音处理
摘要
自监督表示学习方法因能够在大量无标注数据上训练模型而日益流行,并已在自然语言处理、计算机视觉和语音等多样领域展现出成功。先前语音领域的自监督工作已对语音的多个属性(如语言内容、说话人身份和节奏)进行了解耦。在本工作中,我们引入一种自监督方法将房间声学从语音中解耦,并将该声学表示用于设备仲裁的下游任务。我们的结果表明,在标注训练数据稀缺时,所提方法相较基线显著提升了性能,表明我们的预训练方案学会了编码房间声学信息同时对语音信号的其他属性保持不变性。
引用
@article{arxiv.2302.01483,
title = {SPADE: Self-supervised Pretraining for Acoustic DisEntanglement},
author = {John Harvill and Jarred Barber and Arun Nair and Ramin Pishehvar},
journal= {arXiv preprint arXiv:2302.01483},
year = {2023}
}