Music Transformer
机器学习
2018-12-13 v3 声音
音频与语音处理
机器学习
摘要
音乐严重依赖重复来构建结构与意义。自引用发生在多个时间尺度上,从动机到乐句再到整段音乐的重用,例如具有 ABA 结构的乐曲。Transformer(Vaswani 等,2017)是一种基于自注意力的序列模型,已在许多需要保持长距离一致性的生成任务中取得引人注目的结果。这表明自注意力也可能非常适合建模音乐。然而,在音乐创作与演奏中,相对时序至关重要。Transformer 中用于表示相对位置信息的现有方法基于两两距离调制注意力(Shaw 等,2018)。这对于诸如音乐作品的长序列而言不切实际,因为其用于中间相对信息的记忆复杂度在序列长度上呈二次方。我们提出一种算法,将其中间记忆需求降低至序列长度的线性。这使我们能够展示:带有我们改进的相对注意力机制的 Transformer 可生成分钟级长度的作品(数千步,为 Oore 等,2018 所建模长度的四倍)且结构引人注目,可生成在给定动机上连贯展开的续写,并能在 seq2seq 设定下生成以旋律为条件的伴奏。我们在 JSB Chorales 与 Piano-e-Competition 两个数据集上评估带有我们相对注意力机制的 Transformer,并在后者上取得最先进(SOTA)结果。
引用
@article{arxiv.1809.04281,
title = {Music Transformer},
author = {Cheng-Zhi Anna Huang and Ashish Vaswani and Jakob Uszkoreit and Noam Shazeer and Ian Simon and Curtis Hawthorne and Andrew M. Dai and Matthew D. Hoffman and Monica Dinculescu and Douglas Eck},
journal= {arXiv preprint arXiv:1809.04281},
year = {2018}
}
备注
Improved skewing section and accompanying figures. Previous titles are "An Improved Relative Self-Attention Mechanism for Transformer with Application to Music Generation" and "Music Transformer"