行胜于听:基于编辑体验的音乐风格迁移评估
声音
2021-10-26 v1 人机交互
机器学习
多媒体
音频与语音处理
摘要
音乐生成技术的主观评价多通过基于问卷的听感测试完成,而忽略了音乐作曲、编曲与音轨编辑的视角。本文提出一种编辑测试,以系统化方式评估用户对音乐生成模型的编辑体验。为此,我们设计了一种结合非时序推断架构、自回归模型与 Transformer 的新音乐风格迁移模型,作为同一风格迁移任务上基线模型的改进。随后,我们以常规听感测试与所提编辑测试对比两模型性能,其中生成样本的质量由用户润色音乐片段所花费的努力量(如所需键鼠操作次数)来评估。在两种目标风格上的结果表明,相较基线模型的改进可由编辑测试定量反映。此外,编辑测试提供了常规听感测试无法获得的深刻见解。本文的主要贡献是编辑测试及其相应见解的系统化呈现,而所提基于最先进神经网络之音乐风格迁移模型则构成另一贡献。
引用
@article{arxiv.2110.12855,
title = {Actions Speak Louder than Listening: Evaluating Music Style Transfer based on Editing Experience},
author = {Wei-Tsung Lu and Meng-Hsuan Wu and Yuh-Ming Chiu and Li Su},
journal= {arXiv preprint arXiv:2110.12855},
year = {2021}
}
备注
9 pages, Proceedings of the 29th ACM International Conference on Multimedia