基于转录提示的 Whisper 语音标注——字典增强解码法
计算与语言
2025-06-10 v1 声音
音频与语音处理
摘要
本文提出一种方法,用于对给定的音频-转录对进行语音学和韵律标签标注,旨�构建日语文本转换语音 (TTS) 数据集。我们的做法是对大规模预训练自动语音识别 (ASR) 模型进行微调,使其在给定真实转录的条件下,同时输出词级别的 grapheme 和标注标签。为进一步纠正语音学标注中的错误,我们采用利用字典先验知识的解码策略。客观评估结果表明,我们提出的方法优于仅依赖文本或音频的先前方法。主观评估结果表明,使用我们的方法标注的标签训练的 TTS 模型,其合成语音的自然度与使用人工标注的模型相当。
引用
@article{arxiv.2506.07646,
title = {Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation},
author = {Rui Hu and Xiaolong Lin and Jiawang Liu and Shixi Huang and Zhenpeng Zhan},
journal= {arXiv preprint arXiv:2506.07646},
year = {2025}
}
备注
Accepted to INTERSPEECH 2025