中文

MERaLiON-AudioLLM:用大语言模型连接音频与语言

计算与语言 2025-01-17 v3 人工智能

摘要

我们提出MERaLiON-AudioLLM(Multimodal Empathetic Reasoning and Learning in One Network),这是首个针对新加坡多语言、多文化环境定制的语音-文本模型。该模型在新加坡国家大语言模型资助计划下开发,集成了先进的语音和文本处理技术,以应对当地口音和方言的多样化语言细微差别,提升在复杂多语言环境中的可访问性和可用性。我们的结果表明,该模型在语音识别和任务特定理解方面均有改进,使MERaLiON-AudioLLM成为面向区域特定AI应用的先驱解决方案。我们设想此次发布将为未来旨在解决本地化语言和文化环境的模型树立先例。

关键词

引用

@article{arxiv.2412.09818,
  title  = {MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models},
  author = {Yingxu He and Zhuohan Liu and Shuo Sun and Bin Wang and Wenyu Zhang and Xunlong Zou and Nancy F. Chen and Ai Ti Aw},
  journal= {arXiv preprint arXiv:2412.09818},
  year   = {2025}
}

备注

https://huggingface.co/MERaLiON/MERaLiON-AudioLLM-Whisper-SEA-LION