利用中层感知特征与情感词嵌入的表达感知音乐演奏检索
声音
2024-01-29 v1 信息检索
音频与语音处理
摘要
本文探索了跨模态音乐检索的一个特定子任务。我们考虑一项精细的任务:基于对同一音乐作品的不同演奏集合的风格、表达特征或情感的描述,检索出该作品的一个特定演奏或演绎版本。我们观察到,为学习通用文本-音频嵌入空间而训练的通用跨模态系统在此任务上并未产生最优结果。通过引入两项改动——分别针对文本编码器和音频编码器——我们在一个包含钢琴演奏及相关自由文本描述的数据集上展示了性能的提升。在文本端,我们使用情感增强的词嵌入(EWE);在音频端,我们提取中层感知特征而非通用音频嵌入。我们的结果突显了从音乐中学习的中层感知特征和从情感标记文本中学习的情感增强词嵌入在跨模态环境下捕捉音乐表现力的有效性。此外,我们可解释的中层特征为检索和下游推荐过程提供了引入可解释性的途径。
引用
@article{arxiv.2401.14826,
title = {Expressivity-aware Music Performance Retrieval using Mid-level Perceptual Features and Emotion Word Embeddings},
author = {Shreyan Chowdhury and Gerhard Widmer},
journal= {arXiv preprint arXiv:2401.14826},
year = {2024}
}
备注
Presented at FIRE 2023 (Forum for Information Retrieval Evaluation) conference, Goa, India