通过隐式思维链内化ASR实现高效的语音到语音对话大语言模型
计算与语言
2024-11-05 v3
摘要
当前基于语音的大语言模型主要在大量的ASR和TTS数据集上训练,在这些相关任务上表现出色。然而,它们处理直接语音到语音对话的能力仍然受到显著限制。这些模型通常依赖ASR到TTS的思维链流程,先将语音转换为文本进行处理,再生成音频响应,这引入了延迟并丢失了音频特征。我们提出了一种方法,将ASR思维链隐式内化到语音大语言模型中,增强其原生语音理解能力。我们的方法降低了延迟,并提高了模型对语音的原生理解,为更高效、更自然的实时音频交互铺平了道路。我们还发布了一个大规模合成对话数据集,以促进进一步研究。
引用
@article{arxiv.2409.17353,
title = {Internalizing ASR with Implicit Chain of Thought for Efficient Speech-to-Speech Conversational LLM},
author = {Robin Shing-Hei Yuen and Timothy Tin-Long Tse and Jian Zhu},
journal= {arXiv preprint arXiv:2409.17353},
year = {2024}
}
备注
Updated for reviewer comments