BA-SOT:用于多说话人语音识别的边界感知序列化输出训练
声音
2023-10-06 v3 计算与语言
音频与语音处理
摘要
近期提出的序列化输出训练(SOT)通过生成由特殊标记分隔的说话人转写文本,简化了多说话人自动语音识别(ASR)。然而,频繁的说话人切换会使说话人变更预测变得困难。为此,我们提出边界感知序列化输出训练(BA-SOT),其通过说话人变更检测任务和边界约束损失将边界知识显式地引入解码器。我们还引入了两阶段连接主义时序分类(CTC)策略,该策略结合令牌级SOT CTC以恢复时间上下文信息。除典型的字符错误率(CER)外,我们引入话语相关字符错误率(UD-CER)以进一步衡量说话人变更预测的精度。相较于原始SOT,BA-SOT将CER/UD-CER降低了5.1%/14.0%,而利用预训练ASR模型进行BA-SOT模型初始化进一步将CER/UD-CER降低了8.4%/19.9%。
引用
@article{arxiv.2305.13716,
title = {BA-SOT: Boundary-Aware Serialized Output Training for Multi-Talker ASR},
author = {Yuhao Liang and Fan Yu and Yangze Li and Pengcheng Guo and Shiliang Zhang and Qian Chen and Lei Xie},
journal= {arXiv preprint arXiv:2305.13716},
year = {2023}
}
备注
Accepted by INTERSPEECH 2023