中文

模拟真实语音重叠可改善多说话人 ASR

音频与语音处理 2022-11-21 v2 计算与语言 声音

摘要

多说话人自动语音识别(ASR)已被研究用于生成自然对话的转写文本,包括多个说话人的重叠语音。由于难以获取带有高质量人工转写的真实对话数据,传统上采用随机混合多条语音的朴素多说话人语音模拟用于模型训练。在本文中,我们提出了一种改进技术,利用真实语音重叠来模拟多说话人重叠语音,其中任意的语音重叠模式由离散词符序列表示。借助该表示,可基于统计语言模型(如 N-gram)从真实对话中学习语音重叠模式,进而用于生成训练用的多说话人语音。在我们的实验中,采用所提方法训练的多说话人 ASR 模型在多个数据集上词错误率均显示一致改善。

关键词

引用

@article{arxiv.2210.15715,
  title  = {Simulating realistic speech overlaps improves multi-talker ASR},
  author = {Muqiao Yang and Naoyuki Kanda and Xiaofei Wang and Jian Wu and Sunit Sivasankaran and Zhuo Chen and Jinyu Li and Takuya Yoshioka},
  journal= {arXiv preprint arXiv:2210.15715},
  year   = {2022}
}

备注

v2: fix minor typo