中文

利用蒙特卡洛树搜索控制符号音乐生成中的感知情感

声音 2022-09-02 v4 机器学习 多媒体 音频与语音处理

摘要

本文提出一种利用蒙特卡洛树搜索在符号音乐生成中控制情感的新方法。我们使用蒙特卡洛树搜索作为解码机制,将语言模型学习到的概率分布导向给定情感。在解码过程的每一步,我们使用 Predictor Upper Confidence for Trees(PUCT,树预测上置信界)搜索由情感分类器和判别器分别给出的情感与质量平均价值最大的序列。我们使用语言模型作为 PUCT 的策略,并将情感分类器与判别器的组合作为其价值函数。为解码音乐作品中的下一个音符,我们从搜索期间创建的节点访问分布中采样。我们使用直接从生成样本计算出的一组客观指标,针对人类创作作品评估生成样本的质量。我们还进行了用户研究,以评估人类受试者对生成样本质量与情感的感知。我们将 PUCT 与随机双目标束搜索(SBBS)和条件采样(CS)进行比较。结果表明,PUCT 在几乎所有音乐质量与情感指标上均优于 SBBS 和 CS。

关键词

引用

@article{arxiv.2208.05162,
  title  = {Controlling Perceived Emotion in Symbolic Music Generation with Monte Carlo Tree Search},
  author = {Lucas N. Ferreira and Lili Mou and Jim Whitehead and Levi H. S. Lelis},
  journal= {arXiv preprint arXiv:2208.05162},
  year   = {2022}
}

备注

Accepted for publication at the 18th AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE-22)