中文

Jam-ALT:一个考虑格式感知的歌词转写基准

音频与语音处理 2023-11-27 v1 计算与语言 机器学习 声音

摘要

当前的自动歌词转写(ALT)基准仅关注词语内容,而忽略了书面歌词更精细的细微差别,包括格式与标点,这导致与音乐人及词曲作者的创作产物以及听众体验的潜在错位。例如,换行在传达节奏、情感强调、押韵和高级结构等信息方面十分重要。为解决此问题,我们引入 Jam-ALT,一个基于 JamendoLyrics 数据集的新歌词转写基准。我们的贡献有两点。其一,对转写文本进行全面修订,专门面向 ALT 评估,遵循新制定的统一音乐行业指南的标注规范,涵盖标点、换行、拼写、背景人声和非词语声音等方面。其二,一套不同于传统词错误率的评估指标套件,用以捕捉此类现象。我们希望所提出的基准有助于 ALT 任务,实现对转写系统更精确可靠的评估,并提升歌词应用(如现场字幕或卡拉 OK 的字幕渲染)中的用户体验。

关键词

引用

@article{arxiv.2311.13987,
  title  = {Jam-ALT: A Formatting-Aware Lyrics Transcription Benchmark},
  author = {Ondřej Cífka and Constantinos Dimitriou and Cheng-i Wang and Hendrik Schreiber and Luke Miner and Fabian-Robert Stöter},
  journal= {arXiv preprint arXiv:2311.13987},
  year   = {2023}
}

备注

6 pages (3 pages main content); website: https://audioshake.github.io/jam-alt/; data: https://huggingface.co/datasets/audioshake/jam-alt; code: https://github.com/audioshake/alt-eval/