听但不能读:基于双塔多模态系统的乐器识别评估
声音
2024-07-26 v1 计算与语言
信息检索
机器学习
音频与语音处理
摘要
音乐双塔多模态系统将音频和文本模态整合到联合的音频-文本空间中,从而实现歌曲及其对应标签之间的直接比较。这类系统为分类和检索提供了新的方法,利用两种模态。尽管它们在零样本分类和检索任务中显示出令人期待的结果,但需要更深入地检查嵌入。本文评估了联合音频-文本空间的内在零样本特性,以乐器识别为案例研究。我们呈现了双塔系统进行零样本乐器识别的评估和分析,以及预联合和联合嵌入空间属性的详细分析。我们的发现表明,音频编码器本身表现良好,而文本编码器或联合空间投影方面仍面临挑战。具体而言,双塔系统对特定单词敏感,偏好通用提示而非音乐化提示。尽管文本编码器具有很大的规模,但尚未充分利用额外的文本上下文或准确推断乐器描述。最后,提出了一种利用乐器本体论量化文本空间语义意义的新方法。该方法揭示了系统对乐器理解的缺陷,并为需要在音乐数据上对文本编码器进行精细调校提供了证据。
引用
@article{arxiv.2407.18058,
title = {I can listen but cannot read: An evaluation of two-tower multimodal systems for instrument recognition},
author = {Yannis Vasilakis and Rachel Bittner and Johan Pauwels},
journal= {arXiv preprint arXiv:2407.18058},
year = {2024}
}
备注
Accepted to ISMIR 2024