WEST:基于大语言模型的语音工具包,用于语音理解、生成与交互
计算与语言
2025-10-30 v2
摘要
在本文中,我们提出了 WEST(WE 语音工具包),一个基于大语言模型(LLM)的语音工具包,用于语音理解、生成与交互。WEST 具有三个关键特征:1)完全基于大语言模型:通过复用成熟架构、生态系统(如 Hugging Face)和方法(如序列打包),站在巨人的肩膀上。2)全栈:支持识别、合成、理解、对话和多模态能力等任务,并可扩展以纳入开源模型。3)简单且易用:每个人都能使用的简单语音工具包。此外,WEST 提供两种类型的方案、模型和实验结果。第一种完全基于开源模型和开源数据,允许用户完全复现本文中的实验,并作为验证系统或最小系统基线。第二种在大量数据上训练,提供更优性能,用户可直接开箱即用。WEST 在 https://github.com/wenet-e2e/west/ 公开可用。
引用
@article{arxiv.2509.19902,
title = {WEST: LLM based Speech Toolkit for Speech Understanding, Generation, and Interaction},
author = {Binbin Zhang and Chengdong Liang and Shuai Wang and Xuelong Geng and Zhao Guo and Haoyu Li and Hao Yin and Xipeng Yang and Pengshen Zhang and Changwei Ma and Lei Xie},
journal= {arXiv preprint arXiv:2509.19902},
year = {2025}
}