面向多语言广播与机构语音自动转录的口语语言识别策略探索
音频与语音处理
2024-06-14 v1 计算与语言
声音
摘要
本文研究了多语言广播和机构语音的口语语言识别(SLI)与语音识别,这些是SLI文献中很少涉及的实际应用场景。观察到在这些领域中,语言变化主要与说话人变化相关,我们提出了一种由说话人日志和语言识别组成的级联系统,并将其与更传统的语言识别和语言日志系统进行比较。结果表明,所提出的系统通常能实现更低的语言分类和语言日志错误率(语言日志错误率相对降低高达10%,语言混淆相对降低60%),并在多语言测试集上获得更低的词错误率(WER相对降低超过8%),同时不会对单语音频的语音识别产生负面影响(相对于单语ASR,绝对WER增加在0.1%到0.7%之间)。
引用
@article{arxiv.2406.09290,
title = {Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech},
author = {Martina Valente and Fabio Brugnara and Giovanni Morrone and Enrico Zovato and Leonardo Badino},
journal= {arXiv preprint arXiv:2406.09290},
year = {2024}
}
备注
Accepted to Interspeech 2024