中文

LiMuSE:轻量级多模态说话人提取

音频与语音处理 2022-10-12 v3 声音

摘要

空间信息、面部表情与声纹等多模态线索被引入语音分离与说话人提取任务,作为互补信息以提升性能。然而,这些线索的引入带来参数数量与模型复杂度的增加,使模型更难部署于资源受限设备。本文提出轻量级多模态说话人提取框架LiMuSE,以缓解上述问题。我们提议在上下文编解码器模块、音频块与融合块中使用配备GC的TCN,其将组通信(GC)与时间卷积网络(TCN)相结合。在MC_GRID数据集上的实验表明,LiMuSE以远少参数与更低模型复杂度取得相当或更优性能。我们进一步考察了LiMuSE量化的影响。我们的代码与数据集已公开。

关键词

引用

@article{arxiv.2111.04063,
  title  = {LiMuSE: Lightweight Multi-modal Speaker Extraction},
  author = {Qinghua Liu and Yating Huang and Yunzhe Hao and Jiaming Xu and Bo Xu},
  journal= {arXiv preprint arXiv:2111.04063},
  year   = {2022}
}

备注

Accepted to IEEE SLT 2022