增强、丢弃与交换:提升 LLM 字幕多样性以实现高效的音乐-文本表示学习
声音
2024-09-19 v1 人工智能
计算与语言
音频与语音处理
摘要
音频-文本对比模型已成为音乐表示学习中的一种强大方法。尽管它们在实证上取得了成功,但关于关键设计选择如何影响通过此框架学习的音乐-文本表示质量,人们知之甚少。在这项工作中,我们在有限数据和计算预算的约束下揭示了这些设计选择,并基于实证观察,沿着三个轴建立了对其影响的更可靠理解:基础编码器的选择、训练数据的整理程度以及文本增强的使用。我们发现,在资源受限的场景下,数据整理是音乐-文本对比训练中最重要的因素。受此洞察的启发,我们引入了两种新技术:增强视图丢弃(Augmented View Dropout)和文本交换(TextSwap),它们增加了训练中看到的文本输入的多样性和描述性。通过实验,我们证明这些技术在不同的预训练方案、模型架构和下游数据分布中都能有效提升性能,而不会产生更高的计算成本或需要额外的训练数据。
引用
@article{arxiv.2409.11498,
title = {Augment, Drop & Swap: Improving Diversity in LLM Captions for Efficient Music-Text Representation Learning},
author = {Ilaria Manco and Justin Salamon and Oriol Nieto},
journal= {arXiv preprint arXiv:2409.11498},
year = {2024}
}
备注
To appear in the Proceedings of the 25th International Society for Music Information Retrieval Conference (ISMIR 2024)