SELMA:面向虚拟助理交互的语音语言模型
声音
2025-02-04 v2 计算与语言
机器学习
音频与语音处理
摘要
本文提出并评估了SELMA(Speech-Enabled Language Model),一种集成音频和文本输入于大语言模型(LLM)的语音语言模型,专为虚拟助理交互设计。SELMA旨在单一端到端模型中同时处理与虚拟助理交互相关的三项主要任务和两项辅助任务。我们采用低秩适应模块,对音频编码器和大语言模型进行参数高效训练。此外,我们实现了一种特征池化策略,使系统能够识别全局模式并提高对不依赖单个序列元素的任务的准确率。在Voice Trigger(VT)检测、Device-Directed Speech Detection(DDSD)和自动语音识别(ASR)任务上的实验结果表明,我们的方法显著简化了虚拟助理通常的输入处理流程,同时在针对每个单独任务的专用模型上也取得了更好的性能。SELMA在VT检测任务上实现了64%的相对误差率相等(Equal-Error Rate)改进,在DDSD上实现了22%的改进,同时也接近基线的词错误率。
引用
@article{arxiv.2501.19377,
title = {SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions},
author = {Dominik Wagner and Alexander Churchill and Siddharth Sigtia and Erik Marchi},
journal= {arXiv preprint arXiv:2501.19377},
year = {2025}
}
备注
Accepted at ICASSP 2025