中文

基于序列化输出训练的联合自动语音识别与说话人角色标注

音频与语音处理 2025-06-13 v1 声音

摘要

自动语音识别(ASR)系统凭借大规模预训练模型取得了显著进展。然而,大多数当前系统仅专注于转录语音,而不识别说话人角色,这一功能对于对话AI至关重要。在本工作中,我们研究了使用序列化输出训练(SOT)进行联合ASR和说话人角色标注。通过为Whisper添加角色特定令牌并使用SOT进行微调,我们使模型能够在单次解码过程中生成具备角色感知的转录结果。我们将SOT方法与两个真实对话数据集上的自监督先前基线方法进行了比较。我们的发现表明,该方法在多说话人词错误率上实现了超过10%的降低,证明了其作为统一模型实现说话人角色感知语音转录的可行性。

关键词

引用

@article{arxiv.2506.10349,
  title  = {Joint ASR and Speaker Role Tagging with Serialized Output Training},
  author = {Anfeng Xu and Tiantian Feng and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2506.10349},
  year   = {2025}
}

备注

Under review