CASA-ASR:上下文感知的说话人归因语音识别
音频与语音处理
2023-05-23 v1 声音
摘要
近年来,说话人归因自动语音识别(SA-ASR)广受关注,其旨在回答“谁说了什么”的问题。与模块化系统不同,端到端(E2E)SA-ASR直接最小化说话人相关识别错误,并展现出良好的适用性。本文中,我们通过增强E2E SA-ASR的上下文建模能力,提出了一种上下文感知SA-ASR(CASA-ASR)模型。具体而言,在CASA-ASR中,引入上下文文本编码器以聚合整个话语的语义信息,并采用上下文相关打分器通过与上下文中说话人进行比对来建模说话人可区分性。此外,进一步提出两遍解码策略以充分利用上下文建模能力,从而获得更好的识别性能。在AliMeeting语料库上的实验结果表明,所提出的CASA-ASR模型优于原始E2E SA-ASR系统,在说话人相关字符错误率上取得了11.76%的相对提升。
引用
@article{arxiv.2305.12459,
title = {CASA-ASR: Context-Aware Speaker-Attributed ASR},
author = {Mohan Shi and Zhihao Du and Qian Chen and Fan Yu and Yangze Li and Shiliang Zhang and Jie Zhang and Li-Rong Dai},
journal= {arXiv preprint arXiv:2305.12459},
year = {2023}
}
备注
Accepted by Interspeech2023