中文

COMET:音频文本多模态对比嵌入概念空间分解

声音 2026-05-29 v1 人工智能 计算与语言 机器学习 音频与语音处理

摘要

对比式语言-音频预训练(CLAP)模型广泛用于音频理解,并支持许多零样本应用中的模态无关条件置换。然而,其性能严受模态间鸿沟的影响。现有解释主要将其归因于锥形效应,视其为均值嵌入之间的偏移,但仅纠正均值仅能获得有限的改进。另一些假设,如信息不平衡和维度坍缩,也提出,但尚未得到充分验证,也未在音频领域深入研究。与此同时,一些研究尝试将多模态对比嵌入分解为可解释概念,但从概念分解的角度分析模态鸿沟的工作仍不存在。本文引入COMET(Concept space Organization and Modality gap Explanation with PLS-SVD Transformation),一种基于偏最小二乘奇异值分解(PLS-SVD)的CLAP新框架,从更广泛的角度揭示了模态鸿沟。我们的框架表明,仅有一小部分可解释轴(捕获共享概念)对相似度计算贡献巨大,均值分量仅部分代表模态鸿沟。基于此洞察,我们提出一种简单的文件截断方法,无需训练即可缓解模态鸿沟。该方法使零样本音频描述带条件置换接近完全监督性能,无需大型辅助内存库或高昂计算成本。与此同时,它实现了显著的嵌入维度降低,同时保持在检索和音频描述任务上的强性能。

关键词

引用

@article{arxiv.2605.29628,
  title  = {COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings},
  author = {Yonggang Zhu and Liting Gao and Aidong Men and Wenwu Wang},
  journal= {arXiv preprint arXiv:2605.29628},
  year   = {2026}
}