跨语言和音乐类型的合成歌词检测
计算与语言
2025-04-25 v4 人工智能
机器学习
摘要
近年来,使用大型语言模型(LLMs)生成音乐内容,尤其是歌词,受到广泛关注。这些进展为艺术家提供了有价值的工具,增强了他们的创作过程,但也引发了关于侵犯版权、消费者满意度和内容垃圾化的担忧。以往的研究探索了在 various领域的内容检测。然而,尚无研究聚焦于音乐中的文本模态——歌词。为填补这一空白,我们构建了一个来自多语言、多音乐类型和多位艺术家的真实与合成歌词的多样化数据集。该生成管道通过人类和自动化方法进行了验证。我们对现有的合成文本检测方法在歌词上的进行了彻底的评估,这是此前未曾探索的数据类型。我们还研究了通过无监督域适应方法,将表现最好的特征适应到歌词中的方法。在遵循音乐和工业约束的前提下,我们检验了这些方法在跨语言、数据可获得性规模、处理多语言内容以及在few-shot设置下处理新音乐类型的泛化能力。我们的发现表明,这些方法在跨语言和跨类型检测合成歌词方面具有前景,可为围绕AI生成音乐的政策决策提供信息,并提高用户透明度。
引用
@article{arxiv.2406.15231,
title = {Synthetic Lyrics Detection Across Languages and Genres},
author = {Yanis Labrak and Markus Frohmann and Gabriel Meseguer-Brocal and Elena V. Epure},
journal= {arXiv preprint arXiv:2406.15231},
year = {2025}
}
备注
Published in the TrustNLP Workshop at NAACL 2025