可迁移的语音到文本大语言模型对齐模块
计算与语言
2024-06-21 v1 声音
音频与语音处理
摘要
通过利用大语言模型(LLM)和语音基础模型的强大能力,基于语音-文本双模态的最先进工作能够实现诸如 spoken translation(ST)和 question answering(SQA)等具有挑战性的任务,并且具有更为简洁的架构。本文利用Whisper编码器和预训练Yi-6B的能力。经验结果表明,仅需一个层级模块和数百小时的语音-文本多任务语料库即可实现模态对齐。我们进一步用人类偏好对齐版的Yi-6B-Chat取代Yi-6B进行推理,发现对齐能力同样适用。此外,单值分解(SVD)揭示的对齐子空间也暗示了线性对齐子空间是稀疏的,这为将其他特征(如声纹或视频)拼接以扩充模态提供了可能。
关键词
引用
@article{arxiv.2406.13357,
title = {Transferable speech-to-text large language model alignment module},
author = {Boyong Wu and Chao Yan and Haoran Pu},
journal= {arXiv preprint arXiv:2406.13357},
year = {2024}
}
备注
Accepted by InterSpeech 2024; 5 pages, 2 figures