中文

利用音乐源分离结合Whisper实现自动歌词转录

声音 2025-06-19 v1 音频与语音处理

摘要

尽管近年来基于Transformer的架构在自动语音识别方面取得了巨大进步,但自动歌词转录在音乐信息检索领域仍然是一项具有挑战性的任务。ALT的主要挑战之一是,由于音乐伴奏,干扰音频信号的幅度相对于传统ASR较高。音乐源分离的最新进展使得自动提取高质量的人声分离成为可能,这有可能提高ALT性能。然而,为了建立其使用的最佳实践,源分离的效果尚未得到系统研究。本文使用最先进的开源ASR模型Whisper,研究了源分离对ALT的影响。我们评估了Whisper在原始音频、分离人声和人声主干上的短格式和长格式转录任务中的性能。对于短格式,我们提出了一种拼接方法,该方法能持续降低词错误率。对于长格式,我们提出了一种算法,利用源分离作为人声活动检测器来推导片段边界,与Whisper的原生长格式算法相比,该算法能持续降低WER。我们的方法在Jam-ALT长格式ALT基准测试中,为开源系统取得了最先进的结果,且无需任何训练或微调。我们还发布了MUSDB-ALT,这是第一个遵循Jam-ALT指南的长格式歌词转录数据集,其人声主干可公开获取。

关键词

引用

@article{arxiv.2506.15514,
  title  = {Exploiting Music Source Separation for Automatic Lyrics Transcription with Whisper},
  author = {Jaza Syed and Ivan Meresman Higgs and Ondřej Cífka and Mark Sandler},
  journal= {arXiv preprint arXiv:2506.15514},
  year   = {2025}
}

备注

Accepted at 2025 ICME Workshop AI for Music