提示 Whisper 以改进逐字转录与端到端误读检测
机器学习
2025-05-30 v1
摘要
识别朗读时犯的错误(即误读)通常是通过将自动语音识别(ASR)转录与目标阅读文本进行比较来事后处理的。然而,当 ASR 对逐字语音转录不准确时,事后处理方法表现不佳。为了改进当前的阅读错误标注方法,我们提出了一种新颖的端到端架构,该架构通过提示整合目标阅读文本,并针对改进逐字转录和直接误读检测进行训练。我们的贡献包括:首先,证明了通过提示整合阅读文本比微调更有利于逐字转录性能;其次,表明了扩展语音识别任务以进行端到端误读检测是可行的。我们进行了两项案例研究——儿童朗读和成人非典型语音——并发现与当前 SOTA 相比,我们提出的策略改进了逐字转录和误读检测。
引用
@article{arxiv.2505.23627,
title = {Prompting Whisper for Improved Verbatim Transcription and End-to-end Miscue Detection},
author = {Griffin Dietz Smith and Dianna Yee and Jennifer King Chen and Leah Findlater},
journal= {arXiv preprint arXiv:2505.23627},
year = {2025}
}
备注
Interspeech 2025