中文

表达性音乐数据处理与生成

声音 2025-03-18 v1 人工智能 音频与语音处理

摘要

音乐表现力与连贯性在音乐创作与表演中不可或缺,但在现代 AI 生成模型中常被忽视。在本工作中,我们引入了一种基于聆听的 数据处理技术,用于捕获音乐表演中的表现力。该技术源自韦伯定律,反映了人类听觉感知的真实情况,并在训练输入中保留了音乐的细微之处与表现力。为促进音乐连贯性,我们基于概率链规则对音乐数据中多个参数(如音高、时长、速度等)之间的输出依赖关系进行建模。在实践中,我们将多输出序列模型分解为单输出子模型,并将先前采样的输出作为后续子模型的条件,以诱导条件分布。最后,为从所有生成结果中选取合适的序列,我们提出了一种基于输出熵的临时度量。熵序列被用作选择可预测且稳定生成的准则,并在信息美学度量的框架下进一步研究,以量化音乐倾向中的愉悦感与信息增益。

关键词

引用

@article{arxiv.2503.11896,
  title  = {Expressive Music Data Processing and Generation},
  author = {Jingwei Liu},
  journal= {arXiv preprint arXiv:2503.11896},
  year   = {2025}
}

备注

7 pages, 4 figures