中文

GRASS:面向语音到语义任务的统一生成模型

计算与语言 2023-09-12 v2 声音 音频与语音处理

摘要

本文通过引入一个统一的端到端(E2E)框架来探索语音到语义任务的指令微调技术,该框架基于音频数据的任务相关提示生成目标文本。我们使用大规模多样化数据对模型进行预训练,其中指令-语音对通过文本到语音(TTS)系统构建。大量实验表明,我们所提出的模型在经过微调后,在涵盖语音命名实体识别、语音情感分析、语音问答等许多基准上取得了最先进(SOTA)结果。此外,该模型在零样本与少样本场景下取得了有竞争力的性能。为促进未来语音到语义任务指令微调的研究,我们发布了我们的指令数据集与代码。

关键词

引用

@article{arxiv.2309.02780,
  title  = {GRASS: Unified Generation Model for Speech-to-Semantic Tasks},
  author = {Aobo Xia and Shuyu Lei and Yushu Yang and Xiang Guo and Hua Chai},
  journal= {arXiv preprint arXiv:2309.02780},
  year   = {2023}
}