CompA:弥补音频语言模型组合推理能力的差距
声音
2024-08-01 v4 人工智能
计算与语言
音频与语音处理
摘要
音频的一个基本特性是其组合性。采用对比方法(如CLAP)训练的音频语言模型(ALMs)学习了音频与语言模态间的共享表示,已在包括零样本音频分类、音频检索等许多下游应用中提升性能。然而,这些模型有效执行组合推理的能力仍很大程度上未被探索,亟需进一步研究。本文提出CompA,一组由两个专家标注基准构成、大多含真实世界音频样本的评测集合,用于评估ALMs的组合推理。我们所提CompA-order评估ALM对音频中声学事件顺序或发生情况的理解,CompA-attribute评估声学事件的属性绑定。任一基准中的实例由一对音频-文本对组成,两音频含相同声学事件但组合不同。ALM根据将正确音频匹配正确文本的能力被评估。利用该基准,我们首先表明当前ALMs表现仅略优于随机猜测,因而在组合推理上表现不佳。接着,我们提出CompA-CLAP,通过一种新颖学习方法微调CLAP以提升其组合推理能力。为训练CompA-CLAP,我们首先提出以组合感知困难负样本改进对比训练,实现更聚焦的训练。其次,我们提出一种新颖模块化对比损失,帮助模型学习细粒度组合理解,并克服公开可用组合音频的严重匮乏。CompA-CLAP在CompA基准上显著优于所有基线模型,表明其优越的组合推理能力。
引用
@article{arxiv.2310.08753,
title = {CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models},
author = {Sreyan Ghosh and Ashish Seth and Sonal Kumar and Utkarsh Tyagi and Chandra Kiran Evuru and S. Ramaneswaran and S. Sakshi and Oriol Nieto and Ramani Duraiswami and Dinesh Manocha},
journal= {arXiv preprint arXiv:2310.08753},
year = {2024}
}
备注
ICLR 2024. Project Page: https://sreyan88.github.io/compa_iclr/