DiscreteSLU:用于口语理解的自监督离散语音单元的大型语言模型
计算与语言
2024-06-14 v1 声音
音频与语音处理
摘要
将预训练的基于文本的大型语言模型(LLM)与语音输入集成,已为各种语音任务启用了指令遵循能力。这种集成需要语音编码器、语音适配器和 LLM,需在多样化任务上进行训练。我们提出使用离散语音单元(DSU),而非连续型语音编码器输出,经语音适配器转换为 LLM token 嵌入空间。我们通过自监督语音编码器后接 K 均值聚类生成 DSU。该模型在来自看见/未看见领域的语音输入上表现出稳健的性能,并在口语问答中展现指令遵循能力。我们还探索了来自自监督语音编码器不同层提取的各种类型 DSU,以及梅尔频率倒谱系数(MFCC)。我们的发现表明,ASR 任务和数据集在口语问答任务的指令调优中并非关键。
引用
@article{arxiv.2406.09345,
title = {DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding},
author = {Suwon Shon and Kwangyoun Kim and Yi-Te Hsu and Prashant Sridhar and Shinji Watanabe and Karen Livescu},
journal= {arXiv preprint arXiv:2406.09345},
year = {2024}
}