中文

利用音频信息预训练语言模型解读歌曲歌词

声音 2022-08-25 v1 计算与语言 音频与语音处理

摘要

歌词解读可帮助人们快速理解歌曲及其歌词,也能更易于从不断增长的音乐档案中高效管理、检索和发现歌曲。本文提出 BART-fusion,一种从歌词和音乐音频生成歌词解读的新模型,它将大规模预训练语言模型与音频编码器相结合。我们采用跨模态注意力模块将音频表示融入歌词表示,以帮助预训练语言模型从音频角度理解歌曲,同时保留语言模型原有的生成性能。我们还发布了 Song Interpretation Dataset,一个用于训练和评估我们模型的新大规模数据集。实验结果表明,额外的音频信息帮助我们的模型更好地理解词语与音乐,并生成准确流畅的解读。一项跨模态音乐检索的附加实验表明,由 BART-fusion 生成的解读相比原始 BART 也能帮助人们更准确地检索音乐。

关键词

引用

@article{arxiv.2208.11671,
  title  = {Interpreting Song Lyrics with an Audio-Informed Pre-trained Language Model},
  author = {Yixiao Zhang and Junyan Jiang and Gus Xia and Simon Dixon},
  journal= {arXiv preprint arXiv:2208.11671},
  year   = {2022}
}

备注

Accepted to ISMIR 2022