中文

提升低资源语言和指令遵循能力的音频语言模型

计算与语言 2025-05-26 v2 人工智能 声音 音频与语音处理

摘要

音频语言模型使用文本提示处理音频输入,用于语音识别和音频描述等任务。虽然基于多语言预训练组件,但大多数模型主要在英语上训练,限制了其对其他语言的可用性。本文评估了音频语言模型在泰语(一种低资源语言)上的表现,发现尽管具有多语言基础,模型仍缺乏新兴的跨语言能力。为此,我们探索了数据混合方案,以优化目标语言和英语之间的音频语言模型,同时将音频理解和语音指令遵循整合到统一模型中。我们的实验提供了通过平衡语言特定和多语言训练数据来提高低资源语言指令遵循能力的见解。提出的模型Typhoon-Audio在英语和泰语方面均显著优于现有开源模型,性能与最先进的Gemini-1.5-Pro相当。

关键词

引用

@article{arxiv.2409.10999,
  title  = {Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models},
  author = {Potsawee Manakul and Guangzhi Sun and Warit Sirichotedumrong and Kasima Tharnpipitchai and Kunat Pipatanakul},
  journal= {arXiv preprint arXiv:2409.10999},
  year   = {2025}
}

备注

Interspeech 2025