中文

SA-SOT:面向多人 ASR 的说话人感知序列化输出训练

声音 2024-03-05 v1 音频与语音处理

摘要

多人自动语音识别在涉及多方交互的场景(如会议和对话)中发挥着关键作用。由于其固有的复杂性,该任务正受到越来越多的关注。值得注意的是,序列化输出训练因其简洁的架构和出色的性能而在各种方法中脱颖而出。然而,token 级 SOT (t-SOT) 中频繁的说话人切换给自回归解码器有效利用上下文预测输出序列带来了挑战。为解决这一问题,我们引入了掩码 t-SOT 标签,作为辅助训练损失的基石。此外,我们利用说话人相似度矩阵来改进解码器的自注意力机制。这一策略性调整增强了同一说话人 token 内的上下文关系,同时最小化了不同说话人 token 之间的交互。我们将该方法称为说话人感知 SOT (SA-SOT)。在 Librispeech 数据集上的实验表明,我们的 SA-SOT 在多人测试集上实现了 12.75% 到 22.03% 的相对 cpWER 降低。此外,通过更广泛的训练,我们的方法实现了 3.41% 的惊人 cpWER,在 LibrispeechMix 数据集上创造了新的 SOTA 结果。

关键词

引用

@article{arxiv.2403.02010,
  title  = {SA-SOT: Speaker-Aware Serialized Output Training for Multi-Talker ASR},
  author = {Zhiyun Fan and Linhao Dong and Jun Zhang and Lu Lu and Zejun Ma},
  journal= {arXiv preprint arXiv:2403.02010},
  year   = {2024}
}