中文

基于局部-全局网络与判别性说话人嵌入的可变说话人数端到端说话人日志

声音 2021-05-06 v1 机器学习 音频与语音处理

摘要

我们提出了一种从单通道音频录音执行会议说话人日志的端到端深度网络模型。与传统的基于聚类的说话人日志方法不同,端到端说话人日志模型具有处理说话人重叠以及支持直接判别训练的优势。所提出的系统旨在处理说话人数量未知的会议,使用基于可变数置换不变交叉熵的损失函数。我们引入了若干似乎有助于提升说话人日志性能的组件,包括局部卷积网络后接全局自注意力模块、使用说话人识别组件的多任务迁移学习,以及通过第二阶段精炼模型的顺序方法。这些组件在基于 LibriSpeech 和 LibriTTS 数据集的模拟会议数据上训练和验证;最终评估使用 LibriCSS 进行,该数据集由通过扬声器播放、采用真实声学录制的模拟会议组成。所提出的模型在这些数据上优于先前提出的端到端说话人日志模型。

关键词

引用

@article{arxiv.2105.02096,
  title  = {End-to-End Diarization for Variable Number of Speakers with Local-Global Networks and Discriminative Speaker Embeddings},
  author = {Soumi Maiti and Hakan Erdogan and Kevin Wilson and Scott Wisdom and Shinji Watanabe and John R. Hershey},
  journal= {arXiv preprint arXiv:2105.02096},
  year   = {2021}
}

备注

5 pages, 2 figures, ICASSP 2021