面向事实一致性的语音识别
音频与语音处理
2023-02-27 v1 计算与语言
声音
摘要
本文提出一种用于自动语音识别(ASR)的新型优化框架,旨在减少ASR模型产生的幻觉。所提框架优化ASR模型以最大化ASR假设与真实转写之间预期的事实一致性分数,其中事实一致性分数由单独训练的估计器计算。使用AMI会议语料库和VoxPopuli语料库的实验结果表明,用所提框架训练的ASR模型生成的ASR假设与真实转写的一致性分数显著更高,同时保持的词错误率接近于交叉熵训练的ASR模型。此外,研究表明用所提框架训练ASR模型可提升语音摘要质量,这体现在由大型语言模型生成的会议对话摘要的事实一致性上。
引用
@article{arxiv.2302.12369,
title = {Factual Consistency Oriented Speech Recognition},
author = {Naoyuki Kanda and Takuya Yoshioka and Yang Liu},
journal= {arXiv preprint arXiv:2302.12369},
year = {2023}
}
备注
5 pages, 1 figure, 3 tables