多方会议中说话人归属自动语音识别的比较研究
声音
2022-07-04 v3 计算与语言
音频与语音处理
摘要
本文对多方会议场景下的说话人归属自动语音识别(SA-ASR)进行了比较研究,该主题是会议丰富转写中日益受到关注的课题。具体而言,本研究评估了三种方法。第一种方法FD-SOT由帧级说话人分离模型和多方言ASR组成,以识别说话人并识别话语。说话人归属转写通过对分离结果与识别假设进行对齐获得。然而,这种对齐策略可能因模块独立性导致的时间戳错误而受影响,严重阻碍模型性能。因此,我们提出第二种方法WD-SOT,通过引入词级说话人分离模型来解决对齐错误,从而摆脱此类时间戳对齐依赖。为进一步缓解对齐问题,我们提出第三种方法TS-ASR,联合训练目标说话人分离模块与ASR模块。通过比较每种SA-ASR方法的各类策略,在真实会议场景语料库AliMeeting上的实验结果表明,与FD-SOT方法相比,WD-SOT方法在平均说话人相关字符错误率(SD-CER)上实现了10.7%的相对降低。此外,TS-ASR方法也优于FD-SOT方法,并带来16.5%的平均SD-CER相对降低。
引用
@article{arxiv.2203.16834,
title = {A Comparative Study on Speaker-attributed Automatic Speech Recognition in Multi-party Meetings},
author = {Fan Yu and Zhihao Du and Shiliang Zhang and Yuxiao Lin and Lei Xie},
journal= {arXiv preprint arXiv:2203.16834},
year = {2022}
}
备注
accepted by INTERSPEECH 2022, 5 pages, 2 figures