中文

基于结构化稀疏模型的混响录音多方语音恢复

机器学习 2012-10-26 v1 声音

摘要

我们通过对混响房间的声学特性进行建模来解决多方语音恢复问题。我们的方法利用结构化稀疏模型来进行房间建模和语音恢复。我们提出了一种方案,通过在自由空间模型中对虚拟源的空间谱进行稀疏逼近来定位说话者的早期镜像,从而在未知的竞争语音源中表征房间声学特性。然后,利用每个源的谱时成分的低秩结构对这些镜像进行聚类。这使我们能够确定房间脉冲响应函数的早期支撑及其到房间几何形状的唯一映射。为了进一步解决反射比的模糊性,我们提出了一种混响模型的新颖表述,并通过凸优化估计吸收系数,该优化利用了基于并发语音表示的空间-谱稀疏性构建的联合稀疏模型。随后,将这些声学参数用于通过结构化稀疏恢复或对声学信道进行逆滤波来分离单个语音信号。在真实数据录音上进行的实验证明了所提方法在多方语音恢复和识别中的有效性。

关键词

引用

@article{arxiv.1210.6766,
  title  = {Structured Sparsity Models for Multiparty Speech Recovery from Reverberant Recordings},
  author = {Afsaneh Asaei and Mohammad Golbabaee and Hervé Bourlard and Volkan Cevher},
  journal= {arXiv preprint arXiv:1210.6766},
  year   = {2012}
}

备注

31 pages