优化真实会议应用中的说话人归属自动语音识别说话人分配
计算与语言
2024-09-06 v2
摘要
过去关于端到端会议转录的研究主要集中在模型架构上,且大多在模拟会议数据上进行评估。我们提出了一项新颖的研究,旨在优化说话人归属自动语音识别(SA-ASR)系统在现实生活场景(如 AMI 会议语料库)中的使用,以改进语音片段的说话人分配。首先,我们提出了一条专为涉及语音活动检测(VAD)、说话人日志(SD)和 SA-ASR 的实际应用定制的流水线。其次,我们主张使用 VAD 输出片段来微调 SA-ASR 模型,考虑到其在测试期间也应用于 VAD 片段,并证明这可使说话人错误率(SER)相对降低高达 28%。最后,我们探讨了增强 SA-ASR 系统用作输入的说话人嵌入模板提取的策略。我们表明,从 SD 输出而非标注的说话人片段中提取这些模板,可使 SER 相对降低高达 20%。
引用
@article{arxiv.2403.06570,
title = {Improving Speaker Assignment in Speaker-Attributed ASR for Real Meeting Applications},
author = {Can Cui and Imran Ahamad Sheikh and Mostafa Sadeghi and Emmanuel Vincent},
journal= {arXiv preprint arXiv:2403.06570},
year = {2024}
}
备注
Submitted to Odyssey 2024