Diffusion-Link:用于桥接音频-文本模态差距的扩散概率模型
声音
2025-10-14 v1 人工智能
计算与语言
机器学习
音频与语音处理
摘要
对比式音频语言预训练可生成强大的联合表示,但持续的音频-文本模态差距限制了将多模态编码器与大语言模型(LLM)耦合的效益。我们提出了 Diffusion-Link,一种基于扩散的模态桥接模块,通过生成式方式将音频嵌入映射到文本嵌入分布。该模块在冻结的多模态编码器输出嵌入上进行训练,并实现为包含三个残差 MLP 块的轻量级网络。为评估 Diffusion-Link 对多模态编码器-LLM 耦合的影响,我们在自动音频字幕(AAC)上进行测试;据我们了解,这是扩散式模态桥接首次应用于 AAC。我们报告了两个结果。(1) 模态差距分析:在相似性和几何标准上,Diffusion-Link 在已有扩散方法中以最大程度减少模态差距,并显示出音频嵌入向文本分布迁移的集体趋势。(2) 下游 AAC:将 Diffusion-Link 附加到相同的多模态 LLM 基线,在 AudioCaps 上实现零样本和全监督字幕均达到最先进水平,无需外部知识,分别实现了最高可达 52.5% 和 7.5% 的相对提升。这些发现表明,缩小模态差距对于多模态编码器与 LLM 之间的有效耦合至关重要,扩散式模态桥接为超越以知识检索为中心的设计提供了有前景的方向。代码将在接受后发布 https://github.com/DevKiHyun/Diffusion-Link
引用
@article{arxiv.2510.11330,
title = {Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap},
author = {KiHyun Nam and Jongmin Choi and Hyeongkeun Lee and Jungwoo Heo and Joon Son Chung},
journal= {arXiv preprint arXiv:2510.11330},
year = {2025}
}
备注
5 pages. Submitted to IEEE ICASSP 2026