中文

LLaSM:大语言与语音模型

计算与语言 2023-09-19 v3 机器学习 声音 音频与语音处理

摘要

多模态大语言模型近来引起了广泛关注。尽管如此,大多数工作集中于视觉-语言多模态模型,提供了强大的遵循视觉与语言指令的能力。然而,我们主张语音也是人类与世界交互的重要模态。因此,一个通用助手能够遵循多模态语音与语言指令是至关重要的。在这项工作中,我们提出了大语言与语音模型 (LLaSM)。LLaSM 是一个端到端训练的大型多模态语音-语言模型,具有跨模态对话能力,能够遵循语音与语言指令。我们的早期实验表明,LLaSM 展示了一种更便捷、自然的人与人工智能交互方式。具体而言,我们还发布了一个大型语音指令跟随数据集 LLaSM-Audio-Instructions。代码和演示可在 https://github.com/LinkSoul-AI/LLaSM 和 https://huggingface.co/spaces/LinkSoul/LLaSM 获取。LLaSM-Audio-Instructions 数据集可在 https://huggingface.co/datasets/LinkSoul/LLaSM-Audio-Instructions 获取。

关键词

引用

@article{arxiv.2308.15930,
  title  = {LLaSM: Large Language and Speech Model},
  author = {Yu Shu and Siwei Dong and Guangyao Chen and Wenhao Huang and Ruihua Zhang and Daochen Shi and Qiqi Xiang and Yemin Shi},
  journal= {arXiv preprint arXiv:2308.15930},
  year   = {2023}
}