中文

用于增强德语语音意图识别的大语言模型数据生成

计算与语言 2025-08-11 v1 机器学习 声音

摘要

语音指令的意图识别(IR)对于人工智能(AI)助手系统至关重要;然而,大多数现有方法仅限于短指令,并且主要针对英语开发。本文通过关注老年德语使用者的语音意图识别来解决这些局限性。我们提出了一种新颖的方法,该方法将经过老年德语语音(SVC-de)微调的自适应 Whisper ASR 模型与基于 Transformer 的语言模型相结合,这些语言模型在由三个知名大语言模型(LLMs):LeoLM、Llama3 和 ChatGPT 生成的合成文本数据集上进行训练。为了评估我们方法的鲁棒性,我们使用文本到语音模型生成合成语音,并进行了广泛的跨数据集测试。我们的结果表明,LLM 生成的合成数据显著提升了分类性能以及对不同说话风格和未见词汇的鲁棒性。值得注意的是,我们发现 LeoLM,一个较小的、领域特定的 13B LLM,在德语意图识别的数据集质量上超越了更大的 ChatGPT(175B)。我们的方法表明,生成式 AI 可以有效弥合低资源领域的数据鸿沟。我们提供了数据生成和训练过程的详细文档,以确保透明度和可复现性。

关键词

引用

@article{arxiv.2508.06277,
  title  = {Large Language Model Data Generation for Enhanced Intent Recognition in German Speech},
  author = {Theresa Pekarek Rosin and Burak Can Kaplan and Stefan Wermter},
  journal= {arXiv preprint arXiv:2508.06277},
  year   = {2025}
}

备注

11 pages, 3 figures, accepted at KONVENS 2025