面向设备导向语音检测的融合低秩适配多模态大语言模型
计算与语言
2024-06-17 v1 人机交互
音频与语音处理
摘要
虽然大语言模型(LLM)在模拟人类对话方面显示出前景,但它们主要在文本数据上进行预训练。融合音频或视频可以提升性能,但收集大规模多模态数据和预训练多模态 LLM 具有挑战。为此,我们提出了一种融合低秩适配(FLoRA)技术,通过低秩适配高效地将预训练的单模态 LLM 适配以消费用以前所未见的新模态。对于设备导向语音检测,使用 FLoRA,多模态 LLM 相对于仅基于文本的方法实现了 22% 的相对平等错误率(EER)降低,同时在仅需调参一小部分参数的情况下,达到了与其完整微调(FFT)相当的性能。此外,引入的新型 adapter dropout 使 FLoRA 对缺失数据具有鲁棒性,较 FFT 降低 20% 的 EER 和 56% 的虚警率。该方法在 16M 至 3B 参数的模型规模方面表现良好。
引用
@article{arxiv.2406.09617,
title = {Multimodal Large Language Models with Fusion Low Rank Adaptation for Device Directed Speech Detection},
author = {Shruti Palaskar and Oggi Rudovic and Sameer Dharur and Florian Pesce and Gautam Krishna and Aswin Sivaraman and Jack Berkowitz and Ahmed Hussen Abdelaziz and Saurabh Adya and Ahmed Tewfik},
journal= {arXiv preprint arXiv:2406.09617},
year = {2024}
}
备注
Accepted at Interspeech 2024