F-StrIPE:用于符号音乐生成的快速结构感知位置编码
声音
2025-02-18 v1 人工智能
机器学习
音频与语音处理
摘要
虽然音乐始终是生成式模型(如 Transformer)的难题领域,但近期进展通过利用合适的音乐先验知识而取得了突破。一种利用 Transformer 中位置编码模块来嵌入音乐结构信息的技术是将此类知识插入位置编码(PE)模块。然而,Transformer 的序列长度会带来二次计算成本。本文提出了 F-StrIPE(Fast Structure-Informed Positional Encoding),一种在线性复杂度下工作的结构感知位置编码方案。通过运用基于随机特征的现有核近似技术,我们表明 F-StrIPE 是随机位置编码(Stochastic Positional Encoding, SPE)的一种推广。我们使用旋律和声部和声任务展示了 F-StrIPE 的实证优势。
关键词
引用
@article{arxiv.2502.10491,
title = {F-StrIPE: Fast Structure-Informed Positional Encoding for Symbolic Music Generation},
author = {Manvi Agarwal and Changhong Wang and Gael Richard},
journal= {arXiv preprint arXiv:2502.10491},
year = {2025}
}