中文

面向移动语音通信的轻量级双通道目标说话人分离

声音 2021-06-08 v1 音频与语音处理

摘要

如今,在模型规模与计算复杂度受限的移动设备上部署目标说话人分离(TSS)模型有着强烈需求。为了更好地针对移动语音通信执行 TSS,我们首先基于特定场景构建了一个双通道数据集 LibriPhone。具体而言,为了更好地模拟真实场景,LibriPhone 并非由单通道数据集仿真得到,而是通过两个专业人工头同时回放 LibriSpeech 中的成对语句,并由手机的两个内置麦克风录制而成。随后,我们提出了一种轻量级时频域分离模型 LSTM-Former,其基于 LSTM 框架并采用信噪比(SI-SNR)损失。在 LibriPhone 上的实验中,我们探究了双通道 LSTM-Former 模型以及使用 LibriPhone 随机单通道的单通道版本。实验结果表明,双通道 LSTM-Former 相对提升 25%,优于单通道 LSTM-Former。本工作为移动设备上的 TSS 任务提供了可行方案,在真实应用场景中回放并记录多数据源以获取双通道真实数据,可辅助轻量级模型实现更高性能。

关键词

引用

@article{arxiv.2106.02934,
  title  = {Lightweight Dual-channel Target Speaker Separation for Mobile Voice Communication},
  author = {Yuanyuan Bao and Yanze Xu and Na Xu and Wenjing Yang and Hongfeng Li and Shicong Li and Yongtao Jia and Fei Xiang and Jincheng He and Ming Li},
  journal= {arXiv preprint arXiv:2106.02934},
  year   = {2021}
}