Yin-Yang:具有长期结构与可控性的旋律动机生成框架
声音
2025-01-30 v1 人工智能
符号计算
摘要
Transformer 模型在生成带有局部一致性的符号化音乐方面取得了显著进展。然而,控制旋律动机以结构化方式进行发展,同时保持全局形式,仍是一个开放的研究领域。这一挑战的一个原因是这些模型基于逐音的自回归生成方式,缺乏在偏离动机后自我纠正的能力。此外,这些模型在较短时长数据集上的结构性能也尚未在文献中得到研究。本研究提出了 Yin-Yang 框架,包括旋律生成器、旋律细化器和旋律选择器模型,用于在保持长期结构和可控性的同时,将动机发展为旋律。旋律细化器是在一种新颖的损坏-细化策略下训练的,这使其在生成时间能够产生原动机的旋律和节奏变体,从而纠正旋律生成器的偏差。我们还引入了一种新的目标评估指标,用于量化动机在作品中呈现的平滑程度。评估结果表明,我们的模型在各项指标上均优于最先进的 Transformer 模型,同时具有可控性和半可解释性,为音乐分析开辟了道路。我们的代码和演示页面可在 https://github.com/keshavbhandari/yinyang 查看。
引用
@article{arxiv.2501.17759,
title = {Yin-Yang: Developing Motifs With Long-Term Structure And Controllability},
author = {Keshav Bhandari and Geraint A. Wiggins and Simon Colton},
journal= {arXiv preprint arXiv:2501.17759},
year = {2025}
}
备注
16 Pages, 4 Figures, Accepted at Artificial Intelligence in Music, Sound, Art and Design: 14th International Conference, EvoMUSART 2025