GRASS:面向语音到语义任务的统一生成模型
计算与语言
2023-09-12 v2 声音
音频与语音处理
摘要
本文通过引入一个统一的端到端(E2E)框架来探索语音到语义任务的指令微调技术,该框架基于音频数据的任务相关提示生成目标文本。我们使用大规模多样化数据对模型进行预训练,其中指令-语音对通过文本到语音(TTS)系统构建。大量实验表明,我们所提出的模型在经过微调后,在涵盖语音命名实体识别、语音情感分析、语音问答等许多基准上取得了最先进(SOTA)结果。此外,该模型在零样本与少样本场景下取得了有竞争力的性能。为促进未来语音到语义任务指令微调的研究,我们发布了我们的指令数据集与代码。
引用
@article{arxiv.2309.02780,
title = {GRASS: Unified Generation Model for Speech-to-Semantic Tasks},
author = {Aobo Xia and Shuyu Lei and Yushu Yang and Xiang Guo and Hua Chai},
journal= {arXiv preprint arXiv:2309.02780},
year = {2023}
}