基于微调 wav2vec 2.0 语音分割提升语音翻译准确率与时间效率
音频与语音处理
2023-12-19 v2
摘要
语音翻译(ST)自动将源语言的话语转换为另一种语言的文本。将连续语音分割为较短片段(称为语音分割)在 ST 中起着重要作用。近期为模仿 ST 语料库分割方式而训练的分割方法已超越传统方法。Tsiamas 等人提出了一种基于预训练语音编码器 wav2vec 2.0 的分割帧分类器(SFC),其方法名为 SHAS,在 ST 语料库分割上保留了 95-98% 的 BLEU 分数。然而,SHAS 生成的片段与 ST 语料库分割差异很大,且倾向于更长并合并多个话语。这是由于 SHAS 依赖长度启发式,即它将语音分割为易于翻译长度的片段,而未充分考虑通过分割为更短片段来提升 ST 的潜力。较长片段常降低翻译质量与 ST 的时间效率。在本研究中,我们扩展 SHAS,通过将语音分割为对应句子的较短片段来提升 ST 翻译准确率与效率。我们引入了一种简单的分割算法,使用 SFC 预测的移动平均而不依赖长度启发式,并探索了 wav2vec 2.0 微调以改进语音分割预测。实验结果表明,与 SHAS 相比,我们的语音分割方法显著提升了语音翻译的质量与时间效率。
引用
@article{arxiv.2304.12659,
title = {Improving Speech Translation Accuracy and Time Efficiency with Fine-tuned wav2vec 2.0-based Speech Segmentation},
author = {Ryo Fukuda and Katsuhito Sudoh and Satoshi Nakamura},
journal= {arXiv preprint arXiv:2304.12659},
year = {2023}
}
备注
Accepted by IEEE/ACM Transactions on Audio, Speech, and Language Processing