中文

SeaLLMs-Audio:面向东南亚的大型音频语言模型

计算与语言 2025-11-04 v1 人工智能

摘要

我们介绍 SeaLLMs-Audio,首个为印尼语 (id)、泰语 (th)、越南语 (vi) 等多个东南亚 (SEA) 语言所定制的大型音频语言模型 (LALM),并支持英语 (en) 和中文 (zh)。在大规模音频语料上训练的 SeaLLMs-Audio 在多样化的音频任务中表现出色,涵盖细粒度音频理解和语音交互。其关键特性包括:1) 多语言:模型主要支持 5 种语言,即印尼语、泰语、越南语、英语和中文;2) 多模态:模型接受灵活的输入模态,包括仅音频、仅文本以及音频伴文本;3) 多任务:模型支持广泛的任务,包括音频分析任务如音频描述、自动语音识别、语音到文本翻译、语音情感识别、语音问答和语音摘要。它还支持语音交互,可回答事实性、数学和常识性问题。作为推动东南亚音频 LLM 发展的重要一步,我们期望 SeaLLMs-Audio 能惠及区域研究社区和产业。为自动评估东南亚的 LALM,我们引入 SeaBench-Audio,涵盖多个任务。实验表明,SeaLLMs-Audio 在 SEA 语言上表现与其他 LALM 相当。

关键词

引用

@article{arxiv.2511.01670,
  title  = {SeaLLMs-Audio: Large Audio-Language Models for Southeast Asia},
  author = {Chaoqun Liu and Mahani Aljunied and Guizhen Chen and Hou Pong Chan and Weiwen Xu and Yu Rong and Wenxuan Zhang},
  journal= {arXiv preprint arXiv:2511.01670},
  year   = {2025}
}

备注

10 pages