基于时频跨域联合嵌入与聚类的改进语音分离
声音
2019-04-17 v1 机器学习
音频与语音处理
机器学习
摘要
语音分离在深度学习技术下已非常成功。基于谱图的方法已有大量研究报道,谱图是众所周知的标准时频跨域语音信号表示。它与语音的音素结构高度相关,即人感知时“语音听起来如何”,但主要是携带时间行为的频域特征。最近有非常令人印象深刻的在时域实现语音分离的工作报道,可能是因为时域波形比谱图更精确地描述语音的不同实现。在本文中,我们提出一个恰当整合上述两个方向的框架,希望同时达到两个目的。我们通过拼接一维卷积编码特征图(用于时域)与谱图(用于频域)来构造时频特征图,然后由嵌入网络与聚类方法处理,这些与时空域先前工作所用非常相似。以此方式,时域与频域中的信息以及它们之间的交互在嵌入与聚类时可被联合考虑。在 WSJ0-2mix 数据集上的初步实验中获得了非常鼓舞人心的结果(据我们所知为 SOTA)。
引用
@article{arxiv.1904.07845,
title = {Improved Speech Separation with Time-and-Frequency Cross-domain Joint Embedding and Clustering},
author = {Gene-Ping Yang and Chao-I Tuan and Hung-Yi Lee and Lin-shan Lee},
journal= {arXiv preprint arXiv:1904.07845},
year = {2019}
}
备注
Submitted to Interspeech 2019