面向联合音频-文本模型的有效否定建模
声音
2026-01-21 v1 信息检索
机器学习
摘要
联合音频-文本模型广泛用于音乐检索,但在诸如否定等语义现象方面表现不佳。否定对于区分音乐元素是否存在(例如"有人声" vs. "没有人声")至关重要,但当前系统无法可靠地表示。本文通过在百万歌曲数据集上从头训练 CLAP 模型并采用 LP-MusicCaps-MSD 标题,研究并缓解了这一限制。我们通过文本增强和基于不相似性的对比损失引入否定,以显式分离原始和否定标题在联合嵌入空间中的表示。为评估进展,我们提出了两种将否定建模表述为检索和二元分类任务的协议。实验表明,这两种方法单独使用或组合使用均能改善否定处理,同时在很大程度上保持检索性能。
引用
@article{arxiv.2601.13931,
title = {Towards Effective Negation Modeling in Joint Audio-Text Models for Music},
author = {Yannis Vasilakis and Rachel Bittner and Johan Pauwels},
journal= {arXiv preprint arXiv:2601.13931},
year = {2026}
}
备注
Accepted at IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026