融合记忆与注意力:LSTM、Transformer及混合架构在符号音乐生成中的研究
机器学习
2026-03-24 v1 人工智能
声音
摘要
机器学习技术,如Transformer和长短期记忆(LSTM)网络,在符号音乐生成(SMG)中发挥着关键作用。现有文献表明LSTM与Transformer在建模局部旋律连续性与保持全局结构一致性方面存在差异。然而,它们在SMG语境下的具体特性尚未得到系统性研究。本文通过填补这一空白,对LSTM与Transformer在SMG中的表现进行了细粒度的比较分析,使用17个音乐质量指标在Deutschl数据集上详细考察了局部和全局特性。我们发现LSTM网络擅长捕捉局部模式但无法保持长程依赖,而Transformer有效建模全局结构但倾向于产生不规则的乐句。基于此分析并利用各自的优点,我们提出了一种混合架构,将Transformer编码器与LSTM解码器结合,并将其与两个基线进行了评估。我们在Deutschl数据集上对三种架构各生成的1000首旋律进行了评估。结果表明,混合方法在局部和全局连续性与一致性方面优于基线。我们的工作揭示了这些模型的关键特性,并展示了如何利用其特性来设计更优的模型。我们还通过消融研究和人类感知评估支持了实验,这些从统计上支持了研究发现并为本工作提供了稳健的验证。
引用
@article{arxiv.2603.21282,
title = {Fusing Memory and Attention: A study on LSTM, Transformer and Hybrid Architectures for Symbolic Music Generation},
author = {Soudeep Ghoshal and Sandipan Chakraborty and Pradipto Chowdhury and Himanshu Buckchash},
journal= {arXiv preprint arXiv:2603.21282},
year = {2026}
}
备注
20 pages, 6 figures. Published in Expert Systems with Applications (Elsevier), 2026. DOI: https://doi.org/10.1016/j.eswa.2026.131173