t-SOT FNT:具备纯文本域自适应能力的流式多说话人语音识别
音频与语音处理
2023-09-18 v1 声音
摘要
token 级序列化输出训练(t-SOT)近期被提出以应对流式多说话人自动语音识别(ASR)的挑战。t-SOT 通过将多说话人转写表示为带有穿插的 符号的单条 token 流,有效处理了重叠语音。然而,朴素神经转导器架构的使用极大限制了其纯文本自适应的适用性。为克服该局限,我们提出了一种融合因子化神经转导器(FNT)思想的新型 t-SOT 模型结构。所提方法将语言模型(LM)从转导器的预测器中分离,并处理因 t-SOT 中使用 符号所导致的非自然 token 顺序。我们通过维护多个隐藏状态并在 LM 内对 token 进行特殊处理来实现这一点。所提出的 t-SOT FNT 模型取得了与原始 t-SOT 模型相当的性能,同时保留了通过纯文本自适应在单说话人与多说话人数据集上降低词错误率(WER)的能力。
引用
@article{arxiv.2309.08131,
title = {t-SOT FNT: Streaming Multi-talker ASR with Text-only Domain Adaptation Capability},
author = {Jian Wu and Naoyuki Kanda and Takuya Yoshioka and Rui Zhao and Zhuo Chen and Jinyu Li},
journal= {arXiv preprint arXiv:2309.08131},
year = {2023}
}
备注
5 pages, 2 figures, submitted to ICASSP2024