SpeechTaxi: 面向多语言语义语音分类的探讨
计算与语言
2024-09-11 v1 声音
音频与语音处理
摘要
近期在多语言语音编码与转录方面的进展引发了一个问题:语义语音分类最有效的方法是什么?具体来说,能否通过对微调的领先多语言语音编码器 (MSE) 实现的端到端 (E2E) 分类器,匹配或超越 (2) 级联 (CA) 方法的性能,即先将语音转录为文本,再委托文本分类器进行分类。为此,我们首先构建 SpeechTaxi,一个覆盖28种多语言的80小时语料库,用于语义语音分类(以圣经章节为目标)。随后,我们利用 SpeechTaxi 对 E2E 与 CA 在单语言语义语音分类以及跨语言迁移中的表现进行广泛实验。我们发现,MSE 基于 E2E 在单语言设置下(即在同一语言数据上训练)优于 CA。然而,MSE 似乎在跨语言迁移方面表现不佳,E2E 在 (1) 零样本迁移至训练中未出现的语言以及 (2) 多语言训练(即在多个语言上联合训练)时显著落后于 CA。最后,我们提出一种基于将转录为罗马字文本作为语言中性中间表示的新型 CA 方法,证明其为缺乏原生语音识别支持的语言提供了稳健解决方案。我们的 SpeechTaxi 数据集已公开提供:https://huggingface.co/datasets/LennartKeller/SpeechTaxi/。
引用
@article{arxiv.2409.06372,
title = {SpeechTaxi: On Multilingual Semantic Speech Classification},
author = {Lennart Keller and Goran Glavaš},
journal= {arXiv preprint arXiv:2409.06372},
year = {2024}
}