LiMuSE:轻量级多模态说话人提取
音频与语音处理
2022-10-12 v3 声音
摘要
空间信息、面部表情与声纹等多模态线索被引入语音分离与说话人提取任务,作为互补信息以提升性能。然而,这些线索的引入带来参数数量与模型复杂度的增加,使模型更难部署于资源受限设备。本文提出轻量级多模态说话人提取框架LiMuSE,以缓解上述问题。我们提议在上下文编解码器模块、音频块与融合块中使用配备GC的TCN,其将组通信(GC)与时间卷积网络(TCN)相结合。在MC_GRID数据集上的实验表明,LiMuSE以远少参数与更低模型复杂度取得相当或更优性能。我们进一步考察了LiMuSE量化的影响。我们的代码与数据集已公开。
引用
@article{arxiv.2111.04063,
title = {LiMuSE: Lightweight Multi-modal Speaker Extraction},
author = {Qinghua Liu and Yating Huang and Yunzhe Hao and Jiaming Xu and Bo Xu},
journal= {arXiv preprint arXiv:2111.04063},
year = {2022}
}
备注
Accepted to IEEE SLT 2022