由网络决定学习内容:基于大规模对抗预训练的符号音乐理解模型
声音
2025-06-27 v3 人工智能
音频与语音处理
摘要
作为音乐信息检索 (MIR) 的关键方面,符号音乐理解 (SMU) 因其潜力帮助音乐家和爱好者学习和创作音乐而引起广泛关注。最近,大规模预训练语言模型因符号音乐与自然语言之间的巨大相似性,以及这些模型能够有效利用有限音乐数据的能力而广泛应用于 SMU。然而,一些研究表明,诸如遮蔽语言模型 (MLM) 等常见预训练方法可能在自然语言处理 (NLP) 中引入偏见问题(如种族歧视),这在 SMU 中也会产生类似问题。这种偏见通常源于被遮蔽的标记无法从其上下文中推断出来,迫使模型过拟合训练数据而无法泛化。为解决这一挑战,我们提出了用于 SMU 的 Adversarial-MidiBERT,通过一个 masker 网络自适应地确定 MLM 中的遮蔽内容,而非采用随机遮蔽。通过避免遮蔽难以从上下文中推断的标记,我们的模型更能捕捉上下文结构和关系,而不仅仅是符合训练数据分布。我们在四个 SMU 任务上进行评估,结果在所有情况下都表现出色。我们的模型代码已公开available at https://github.com/RS2002/Adversarial-MidiBERT。
引用
@article{arxiv.2407.08306,
title = {Let Network Decide What to Learn: Symbolic Music Understanding Model Based on Large-scale Adversarial Pre-training},
author = {Zijian Zhao},
journal= {arXiv preprint arXiv:2407.08306},
year = {2025}
}