中文

以众包音乐评论桥接音乐与文本:一种用于主题性音乐评论生成的序列到序列框架

声音 2022-09-07 v1 计算与语言 音频与语音处理

摘要

我们考虑一项自动生成音乐文本描述的新任务。与图像字幕等其他成熟的文本生成任务相比,音乐与文本良好配对数据集的匮乏使其更具挑战性。本文中,我们利用众包音乐评论构建新数据集,并提出一种序列到序列模型以生成音乐文本描述。更具体地,我们使用扩张卷积层作为编码器的基本组件,并以基于记忆的循环神经网络作为解码器。为增强生成文本的真实性与主题性,我们进一步提出利用判别器以及一种新颖的主题评价器对模型进行微调。为衡量生成文本的质量,我们还提出两种新的评价指标,其比 BLEU 等传统指标更贴合人工评价。实验结果验证了我们的模型能够生成流畅且富有意义的评论,同时包含原音乐的主题与内容信息。

关键词

引用

@article{arxiv.2209.01996,
  title  = {Bridging Music and Text with Crowdsourced Music Comments: A Sequence-to-Sequence Framework for Thematic Music Comments Generation},
  author = {Peining Zhang and Junliang Guo and Linli Xu and Mu You and Junming Yin},
  journal= {arXiv preprint arXiv:2209.01996},
  year   = {2022}
}