LyCon:基于大语言模型从词袋中重建歌词
计算与语言
2024-08-28 v1 数字图书馆
摘要
本文针对歌词研究所特有的挑战展开研究,歌词研究常因版权限制而无法直接使用歌词。与典型数据不同,来自网络的歌词常受版权保护,迫使需要替代方法。我们引入一种新方法,从公开可用的词袋 (Bag-of-Words, BoW) 数据集生成无版权歌词。该数据集包含歌词词汇但不包含歌词本身。利用与 BoW 数据集相关的元数据以及大语言模型,我们成功重建了歌词。我们编译并公开了重建歌词数据集 LyCon,与来自知名来源(包括 Million Song Dataset、Deezer 情绪检测数据集与 AllMusic 类型数据集)的元数据对齐。我们认为,利用诸如情绪注释或类型等元数据,能够实现诸如条件歌词生成等多种学术实验。
引用
@article{arxiv.2408.14750,
title = {LyCon: Lyrics Reconstruction from the Bag-of-Words Using Large Language Models},
author = {Haven Kim and Kahyun Choi},
journal= {arXiv preprint arXiv:2408.14750},
year = {2024}
}
备注
Dataset downlodable at https://github.com/havenpersona/lycon