长对话的语音识别与多说话人日记化
音频与语音处理
2020-11-06 v2 机器学习
声音
摘要
语音识别 (ASR) 和说话人日记化 (SD) 模型传统上被分开训练,以产生带说话人标签的丰富对话转录文本。近期进展表明,联合 ASR 和 SD 模型可以学会利用音频-词汇相互依赖关系来改善词日记化性能。我们引入了一个从每周《This American Life》广播节目收集的小时级播客新基准,以在应用于扩展的多说话人对话时更好地比较这些方法。我们发现,当话语边界已知时,训练独立的 ASR 和 SD 模型表现更好,否则联合模型可能表现更好。为处理具有未知话语边界的长对话,我们引入了步幅注意力解码算法和数据增强技术,这些与模型预训练相结合,改善了 ASR 和 SD。
引用
@article{arxiv.2005.08072,
title = {Speech Recognition and Multi-Speaker Diarization of Long Conversations},
author = {Huanru Henry Mao and Shuyang Li and Julian McAuley and Garrison Cottrell},
journal= {arXiv preprint arXiv:2005.08072},
year = {2020}
}