描述符注入跨模态学习:通过谱和旋律特征系统探索音频-MIDI 对齐
声音
2026-04-14 v1 机器学习
摘要
音频录音与符号音乐表示(MIDI)之间的跨模态检索仍具有挑战性,因为连续波形和离散事件序列编码了表演的不同方面。我们研究描述符注入,即将手工制作的领域特征增强到模态特定编码器中,以搭建这一鸿沟。在覆盖 13 种描述符-机制组合、6 种架构家族和 3 种训练计划的三阶段活动中,最佳配置在五个独立随机种子上的平均 S 为 84.0 百分比,比描述符无基线提升了 8.8 个百分点。因果消除显示,基于八度带能量动力学的音频描述符 A4 驱动了顶级双模型的收益,而 MIDI 描述符 D4 仅在推理时产生较弱的效果,尽管改进了训练动力学。我们还引入了逆向跨注意力,其中描述符标记查询编码器特征,减少了注意力操作相对于标准公式,同时保持竞争力。CKA 分析表明,描述符显著增加音频-MIDI transformer 层级对齐,表明是表示收敛而非简单特征拼接。扰动分析识别出高频八度带为主要判别信号。所有实验使用 MAESTRO v3.0.0,评估协议控制作曲家和作品的相似性。
关键词
引用
@article{arxiv.2604.10283,
title = {Descriptor-Injected Cross-Modal Learning: A Systematic Exploration of Audio-MIDI Alignment via Spectral and Melodic Features},
author = {Mariano Fernández Méndez},
journal= {arXiv preprint arXiv:2604.10283},
year = {2026}
}
备注
26 pages, 11 figures, 20 tables. Companion paper to "Harmonic Information Theory: Foundations" (2026). Code: https://github.com/AlterMundi/Phideus