使用 Whisper 实现语音转录与说话人分割联合处理
音频与语音处理
2026-05-08 v1 声音
摘要
作为 MediSpeech 项目的一部分,我们旨在开发一个实时将荷兰语医生与患者之间对话转录并分割的系统。在本研究(进行中)中,我们探索了将 Whisper 与说话人分割(SD)高效组合的方法。经过尝试使用包含说话人标签的文本提示 Whisper,我们观察到其能够以有前景准确率插入标签到转录中。我们继续这一研究线索,通过对 Whisper 进行微调,使其生成类似序列化输出训练(Serialized Output Training, SOT)格式的转录。对 Whisper 进行微调后,长语音块中的说话人 ID 更加一致,并改进了逐字转录。该研究揭示了新的挑战,因为 Whisper 的 SD 性能受到误差通过提示传播以及重叠语音时间戳不准确的影响。
引用
@article{arxiv.2605.05231,
title = {Prompting Whisper for Joint Speech Transcription and Diarization},
author = {Mariia Zamyrova and Henk van den Heuvel},
journal= {arXiv preprint arXiv:2605.05231},
year = {2026}
}
备注
To be presented at the Joint Workshop on HSCMA and CHiME 2026