一模型统御全局?迈向端到端联合说话人日记化与语音识别
音频与语音处理
2023-10-04 v1 计算与语言
声音
摘要
本文提出了一种用于联合说话人日记化(SD)与自动语音识别(ASR)的新框架,名为 SLIDAR(滑动窗口日记化增强识别)。SLIDAR 可处理任意长度输入,并能应对任意数量的说话人,有效并发解决“谁在何时说了什么”。SLIDAR 采用滑动窗口方法,由一个端到端日记化增强语音转写(E2E DAST)模型组成,该模型针对每个窗口在局部提供:转写文本、日记化结果及说话人嵌入。E2E DAST 模型基于编码器-解码器架构,并利用了序列化输出训练和“Whisper 风格”提示等近期技术。随后通过对说话人嵌入进行聚类以获得全局说话人身份,将局部输出组合得到最终的 SD+ASR 结果。在 AMI 语料库单声道录音上的实验证实了该方法在近距离和远场语音场景下的有效性。
引用
@article{arxiv.2310.01688,
title = {One model to rule them all ? Towards End-to-End Joint Speaker Diarization and Speech Recognition},
author = {Samuele Cornell and Jee-weon Jung and Shinji Watanabe and Stefano Squartini},
journal= {arXiv preprint arXiv:2310.01688},
year = {2023}
}