中文

面向词级端到端神经说话人日志的辅助网络方法

音频与语音处理 2023-09-18 v1 机器学习 声音 机器学习

摘要

标准说话人日志试图回答“谁在何时说话”的问题,而现实中大多数相关应用更关注确定“谁说了什么”。无论是传统的模块化方法还是较新的端到端神经日志(EEND),都需要额外的自动语音识别(ASR)模型与编排算法来将说话人标签与识别出的词关联。本文提出带辅助网络的词级端到端神经日志(WEEND),一种在同一神经架构中执行端到端 ASR 与说话人日志的多任务学习算法。即在语音被识别的同时,为每个识别出的词同时预测说话人标签。实验结果表明,WEEND 在所有双说话人短语音场景下均优于基于轮次的日志基线系统,并具备泛化至 5 分钟音频长度的能力。尽管三人及以上说话人对话更为困难,我们发现若有充足的领域内训练数据,WEEND 有潜力提供高质量的带日志文本。

关键词

引用

@article{arxiv.2309.08489,
  title  = {Towards Word-Level End-to-End Neural Speaker Diarization with Auxiliary Network},
  author = {Yiling Huang and Weiran Wang and Guanlong Zhao and Hank Liao and Wei Xia and Quan Wang},
  journal= {arXiv preprint arXiv:2309.08489},
  year   = {2023}
}