自监督语音模型的生成式上下文感知微调
计算与语言
2023-12-18 v1 声音
音频与语音处理
摘要
在为给定话语执行自动语音识别或口语理解等任务时,获取前文或音频提供的上下文信息可以改善性能。考虑到生成式大型语言模型(LLM)的最新进展,我们假设 LLM 能够利用前文生成有用的上下文信息。通过适当的提示,LLM 可以生成对下一句的预测,或生成标题、主题等抽象文本。在本文中,我们研究了 LLM 生成的上下文信息的使用,并提出一种在自监督语音模型微调期间蒸馏所生成信息的方法,我们将其称为生成式上下文感知微调。该方法允许微调后的模型在推理时无需访问真实的相邻片段或 LLM 即可做出更好的预测,同时仅需一个非常小的额外上下文模块。我们使用 SLUE 和 Libri-light 基准在多个下游任务上评估了所提方法:自动语音识别、命名实体识别和情感分析。结果表明,生成式上下文感知微调优于访问真实前文的上下文注入微调方法,且与推理时需要 LLM 的生成式上下文注入微调方法具有竞争力。
引用
@article{arxiv.2312.09895,
title = {Generative Context-aware Fine-tuning of Self-supervised Speech Models},
author = {Suwon Shon and Kwangyoun Kim and Prashant Sridhar and Yi-Te Hsu and Shinji Watanabe and Karen Livescu},
journal= {arXiv preprint arXiv:2312.09895},
year = {2023}
}