pyannote.audio:用于说话人日记化的神经构建模块
音频与语音处理
2019-11-05 v1 声音
摘要
我们介绍 pyannote.audio,一个用 Python 编写的开源说话人日记化工具包。它基于 PyTorch 机器学习框架,提供一组可训练端到端神经构建模块,这些模块可组合并联合优化以构建说话人日记化流水线。pyannote.audio 还附带覆盖广泛领域的预训练模型,用于语音活动检测、说话人变更检测、重叠语音检测以及说话人嵌入——其中大多数达到了最先进的性能。
引用
@article{arxiv.1911.01255,
title = {pyannote.audio: neural building blocks for speaker diarization},
author = {Hervé Bredin and Ruiqing Yin and Juan Manuel Coria and Gregory Gelly and Pavel Korshunov and Marvin Lavechin and Diego Fustes and Hadrien Titeux and Wassim Bouaziz and Marie-Philippe Gill},
journal= {arXiv preprint arXiv:1911.01255},
year = {2019}
}
备注
Submitted to ICASSP 2020