中文

基于提示条件微调的零样本领域敏感语音识别

音频与语音处理 2023-10-09 v2 计算与语言 机器学习

摘要

在本工作中,我们提出一种创建领域敏感语音识别模型的方法,该方法通过以给定文本提示为条件生成来利用文本领域信息。这是通过微调预训练的端到端模型(Whisper)以从带提示示例的演示中学习来实现的。我们表明该能力可泛化至不同领域甚至多种提示语境,我们的模型在来自医疗对话、空中交通管制通信和金融会议等不同领域的未见数据集上获得了高达33%的词错误率(WER)降低。考虑到音频-转录对数据的有限可用性,我们进一步将方法扩展至纯文本微调,以实现领域敏感性与领域自适应。我们证明纯文本微调的模型同样能关注多种提示语境,该模型在医疗对话数据集上达到了最高29%的WER降低。

关键词

引用

@article{arxiv.2307.10274,
  title  = {Zero-shot Domain-sensitive Speech Recognition with Prompt-conditioning Fine-tuning},
  author = {Feng-Ting Liao and Yung-Chieh Chan and Yi-Chang Chen and Chan-Jan Hsu and Da-shan Shiu},
  journal= {arXiv preprint arXiv:2307.10274},
  year   = {2023}
}

备注

F-T Liao and Y-C Chan contributed equally; paper accepted to ASRU2023; code and model weights available in https://github.com/mtkresearch/clairaudience