中文

无监督训练数据的语音助手蒸馏

计算与语言 2024-10-04 v1 人工智能

摘要

语音助手(如 Siri 和 Google Assistant)通常独立建模音频和文本,导致语音信息丢失和复杂度增加。近期通过有监督微调(SFT)训练的端到端语音大语言模型(Speech LLM)努力解决此问题,但导致模型从文本-only LLM中“遗忘”能力。我们的工作提出一种无需指令数据训练 Speech LLM的替代范式,利用文本-only LLM对转录文本的响应作为自监督。重要的是,这一过程可在无标注响应的情况下完成。我们展示我们的蒸馏语音助手(DiVA)可用于口语问答、分类和翻译。 Furthermore, 我们展示 DiVA 在用户偏好方面表现更好,尽管使用计算资源少于 100 倍,仍以 72% 的获胜率击败像 Qwen 2 Audio 这样的前沿模型。

关键词

引用

@article{arxiv.2410.02678,
  title  = {Distilling an End-to-End Voice Assistant Without Instruction Training Data},
  author = {William Held and Ella Li and Michael Ryan and Weiyan Shi and Yanzhe Zhang and Diyi Yang},
  journal= {arXiv preprint arXiv:2410.02678},
  year   = {2024}
}