中文

Speechless: 面向低资源语言的无语音指令训练方法

音频与语音处理 2025-08-26 v1 计算与语言 声音

摘要

大型语言模型(LLM)驱动的语音助手的快速增长凸显了为这些系统提供语音指令数据以进行训练的需求。尽管语音识别数据丰富,但语音指令数据却稀缺,这些数据对于微调模型以理解和执行 spoken commands 至关重要。生成高质量的合成语音需要良好的文本语音(TTS)模型,而低资源语言可能无法获得这一模型。我们提出的新方法通过在语义表示层面中止合成,绕过 TTS 的需求。我们通过将合成语义表示与预训练的 Whisper 编码器对齐,使 LLM 能够在文本指令上进行微调,同时在推理时仍能理解 spoken instructions。这种简化的训练过程是为低资源语言构建语音助手的有前景的方法。

关键词

引用

@article{arxiv.2505.17417,
  title  = {Speechless: Speech Instruction Training Without Speech for Low Resource Languages},
  author = {Alan Dao and Dinh Bach Vu and Huy Hoang Ha and Tuan Le Duc Anh and Shreyas Gopal and Yue Heng Yeo and Warren Keng Hoong Low and Eng Siong Chng and Jia Qi Yip},
  journal= {arXiv preprint arXiv:2505.17417},
  year   = {2025}
}

备注

This paper was accepted by INTERSPEECH 2025