音乐到文本的通感:从音乐录音生成描述性文本
音频与语音处理
2023-05-09 v2 人工智能
计算与语言
多媒体
声音
摘要
在本文中,我们考虑一个新颖的研究问题:音乐到文本的通感。不同于将音乐录音分类至预定义类别的经典音乐标注问题,音乐到文本的通感旨在从具有相同情感的音乐录音生成描述性文本以进一步理解。由于现有音乐相关数据集不含音乐录音的语义描述,我们收集了一个包含1,955对对齐的古典音乐录音与文本描述的新数据集。在此基础上,我们构建计算模型以生成可描述音乐录音内容的句子。为应对高度非判别性的古典音乐,我们设计了一种组拓扑保持损失,其将更多样本作为组参考并保留不同样本间的相对拓扑。大量定性及定量实验结果证明了我们所提模型相对于五种启发式或预训练竞争方法及其在我们所收集数据集上变体的有效性。
引用
@article{arxiv.2210.00434,
title = {Music-to-Text Synaesthesia: Generating Descriptive Text from Music Recordings},
author = {Zhihuan Kuang and Shi Zong and Jianbing Zhang and Jiajun Chen and Hongfu Liu},
journal= {arXiv preprint arXiv:2210.00434},
year = {2023}
}