迈向鲁棒的无监督序列数据解耦——以音乐音频为例
声音
2022-06-16 v2 机器学习
音频与语音处理
摘要
解耦序列自编码器(DSAE)代表一类概率图模型,用动态潜变量和静态潜变量描述观测序列。前者以与观测相同的帧率编码信息,而后者全局地支配整个序列。这引入了归纳偏置,并促进了底层局部与全局因子的无监督解耦。在本文中,我们表明原始 DSAE 对模型架构的选择和动态潜变量的容量敏感,且易于使静态潜变量坍缩。作为对策,我们提出 TS-DSAE,一种两阶段训练框架,先学习序列级先验分布,随后用于正则化模型并促进辅助目标以增进解耦。所提框架完全无监督,并在广泛的模型配置下对全局因子坍缩问题具有鲁棒性。它还避免了通常涉及繁琐参数调优的对抗训练以及特定领域数据增强等典型方案。我们进行了定量与定性评估,以在人工和真实世界音乐音频数据集上展示其在解耦方面的鲁棒性。
引用
@article{arxiv.2205.05871,
title = {Towards Robust Unsupervised Disentanglement of Sequential Data -- A Case Study Using Music Audio},
author = {Yin-Jyun Luo and Sebastian Ewert and Simon Dixon},
journal= {arXiv preprint arXiv:2205.05871},
year = {2022}
}
备注
The paper is accepted to IJCAI 2022