一种上下文潜在空间模型:旋律序列中的子序列调制
机器学习
2021-11-24 v1 人工智能
声音
音频与语音处理
机器学习
摘要
一些用于音乐与文本等序列的生成模型允许我们在给定周围上下文序列的情况下仅编辑子序列,这在交互式引导生成中起着重要作用。然而,编辑子序列主要涉及从可能的生成空间中随机重采样子序列。我们提出一种上下文潜在空间模型(CLSM),以便用户能够在生成空间中带有方向感(例如插值)地探索子序列生成,以及探索变体——语义上相似的可能子序列。CLSM 的生成模型由上下文感知先验与解码器构成,上下文位置感知编码器为推断模型。在实验中,我们使用单声部符号音乐数据集,表明我们的上下文潜在空间在插值上比基线更平滑,且生成样本的质量优于基线模型。生成示例可在线获取。
引用
@article{arxiv.2111.11703,
title = {A Contextual Latent Space Model: Subsequence Modulation in Melodic Sequence},
author = {Taketo Akama},
journal= {arXiv preprint arXiv:2111.11703},
year = {2021}
}
备注
22nd International Society for Music Information Retrieval Conference (ISMIR), 2021; 8 pages