ALCAP:基于对齐增强的音乐描述生成模型
声音
2023-10-24 v3 计算与语言
信息检索
多媒体
音频与语音处理
摘要
随着流媒体平台日益凸显的重要性,音乐描述生成(music captioning)受到了显著关注。传统方法往往优先考虑音乐的音频或歌词方面,无意中忽略了二者之间复杂的相互作用。然而,对音乐的全面理解需要整合这两种元素。在本研究中,我们深入这一被忽视的领域,引入一种通过对比学习系统性地学习音频与歌词之间多模态对齐的方法。这不仅识别并强调了音频与歌词之间的协同作用,还为模型实现更深层的跨模态一致性铺平了道路,从而生成高质量的描述文本。我们提供了理论与实证结果,证明了所提方法的优势,其在两个音乐描述生成数据集上取得了新的SOTA(state-of-the-art)性能。
引用
@article{arxiv.2212.10901,
title = {ALCAP: Alignment-Augmented Music Captioner},
author = {Zihao He and Weituo Hao and Wei-Tsung Lu and Changyou Chen and Kristina Lerman and Xuchen Song},
journal= {arXiv preprint arXiv:2212.10901},
year = {2023}
}