AudioChatLlama:面向大语言模型通用语音能力的研究
计算与语言
2024-04-16 v2 人工智能
摘要
在这项工作中,我们扩展了经过指令微调的 Llama-2 模型,使其具备端到端的通用语音处理与推理能力,同时保持原有 LLM 广泛的多种能力,且无需使用任何精心配对的标注数据。由此得到的端到端模型名为 AudioChatLlama,可将音频提示作为文本的替代并维持对话。该模型还具备扩展的跨模态能力,例如能够执行口语问答(QA)、语音翻译和音频摘要等众多封闭与开放域任务。这不同于先前的语音方法——其中 LLM 被扩展以处理音频,但仅针对有限数量的预设任务。在合成与录制的语音 QA 测试集上,评估表明我们的端到端方法在建模对提示的响应方面与级联系统(语音识别器 + LLM)相当或更优。此外,与级联系统不同,我们的方法可以互换文本与音频模态,并内在地利用对话中的先前上下文以提供更好的结果。
引用
@article{arxiv.2311.06753,
title = {AudioChatLlama: Towards General-Purpose Speech Abilities for LLMs},
author = {Yassir Fathullah and Chunyang Wu and Egor Lakomkin and Ke Li and Junteng Jia and Yuan Shangguan and Jay Mahadeokar and Ozlem Kalinli and Christian Fuegen and Mike Seltzer},
journal= {arXiv preprint arXiv:2311.06753},
year = {2024}
}