面向人类阅读的歌词转录:可读性感知评测基准
音频与语音处理
2024-08-14 v1 计算与语言
机器学习
声音
摘要
为人类消费而书写歌词不仅需要准确捕捉词语序列,还需要融入标点和格式以确保清晰性并传达上下文信息。这包括歌曲结构、情感强调以及主唱与背景人声之间的对比。虽然自动歌词转录(ALT)系统已发展到能够生成非结构化词语串之外的内容,并能够利用更广泛的上下文,但ALT评测基准尚未跟上这一进展,仍然只关注词语。为弥补这一空白,我们提出了Jam-ALT,一个全面的歌词转录评测基准。该基准对JamendoLyrics数据集进行了完整修订,遵循行业歌词转录与格式标准,并设计了用于捕捉和评估歌词特定细微差别的评估指标,为提升歌词可读性奠定基础。我们将该基准应用于近期转录系统,并进行了额外的错误分析以及与古典音乐数据集的实验比较。
引用
@article{arxiv.2408.06370,
title = {Lyrics Transcription for Humans: A Readability-Aware Benchmark},
author = {Ondřej Cífka and Hendrik Schreiber and Luke Miner and Fabian-Robert Stöter},
journal= {arXiv preprint arXiv:2408.06370},
year = {2024}
}
备注
ISMIR 2024 camera-ready. 6 pages + references + supplementary material. Website https://audioshake.github.io/jam-alt/ Data https://huggingface.co/datasets/audioshake/jam-alt Code https://github.com/audioshake/alt-eval/. arXiv admin note: text overlap with arXiv:2311.13987