BEAT:基于统一时间步的符号音乐标记化与生成
声音
2026-05-29 v2 人工智能
摘要
将音乐标记化以适应语言模型的通用框架是一个引人注目的挑战,尤其是考虑到音乐可以以多种符号结构表示(如序列、网格和图)。目前大多数方法将符号音乐标记为 musical events 的序列,如 onset、音高、time shift 或复合音符事件。这种策略直观且在基于 Transformer 的模型中效果良好,但它隐式地处理了音乐时间的规律性: individual tokens 可能跨越不同的持续时间,导致非均匀的时间进展。在本文中,我们考虑另一种可能的标记化方法,即将均匀长度的 musical 步骤(例如一个 beat)作为基本单位。具体而言,我们将单个时间步内的所有事件在同一音高上编码为一个 token,并显式地按时间步对 tokens 进行分组,这类似于钢琴卷帘表示的稀疏编码。我们在 music continuation 和伴奏生成任务上评估了所提出的标记化方法,并与主流基于事件的方法进行比较。结果表明,所提出的标记化在提升音乐质量和结构连贯性方面取得了改进,同时通过额外分析确认了该标记化方法在效率和捕捉长程模式方面的更好表现。
关键词
引用
@article{arxiv.2604.19532,
title = {BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps},
author = {Lekai Qian and Haoyu Gu and Jingwei Zhao and Ziyu Wang},
journal= {arXiv preprint arXiv:2604.19532},
year = {2026}
}