BESTOW:融合GPT与T5两种世界优势的高效可流式语音语言模型
计算与语言
2024-07-01 v1 人机交互
声音
音频与语音处理
摘要
将语音理解能力整合到预训练大型语言模型中已成为重要的研究方向(SpeechLLM)。先前的体系结构可分为:i)GPT样式,将语音提示附加到文本提示作为类似解码器-only模型的LLM输入序列;ii)T5样式,引入语音跨注意力到预训练LLM的每一层。我们提出BESTOW体系结构,将两世界的BESt特征融合到单个高度高效且具有强大多任务能力的模型中。此外,目前尚无明确的流式解决方案可适用于两种体系结构,尤其是考虑到解决方案应适用于语音多任务。我们将可流式SpeechLLM重新表述为读写策略问题,并以BESTOW体系结构统一离线和流式研究。因此,我们展示了首个开源SpeechLLM解决方案,使其能够同时实现流式和多任务扩展(超越ASR)。该可流式解决方案在广泛的语音任务(ASR、AST、SQA、unseen DynamicSuperb)上实现了强劲性能。它是端到端可优化的,训练/推理成本较低,展示了LLM知识向语音的可迁移性。
引用
@article{arxiv.2406.19954,
title = {BESTOW: Efficient and Streamable Speech Language Model with the Best of Two Worlds in GPT and T5},
author = {Zhehuai Chen and He Huang and Oleksii Hrinchuk and Krishna C. Puvvada and Nithin Rao Koluguri and Piotr Żelasko and Jagadeesh Balam and Boris Ginsburg},
journal= {arXiv preprint arXiv:2406.19954},
year = {2024}
}