LAMB:基于 LLM 并通过 Cauchy-Schwarz 散度桥接模态鸿沟的音频字幕生成
声音
2026-03-17 v2 人工智能
摘要
自动音频字幕生成旨在描述输入音频的语义内容。近期的工作采用大语言模型(LLM)作为文本解码器以利用其推理能力。然而,以往在不考虑跨模态对齐的情况下将音频特征投影到 LLM 嵌入空间的方法,未能充分利用这些能力。为解决此问题,我们提出了 LAMB,这是一个基于 LLM 的音频字幕生成框架,它桥接了音频嵌入与 LLM 文本嵌入空间之间的模态鸿沟。LAMB 融合了一个跨模态对齐器,该对齐器在最大化互信息的同时最小化 Cauchy-Schwarz 散度,从而在全局和 token 层面上实现音频与文本之间更紧密的对齐。我们进一步设计了一个双流适配器,用于提取语义丰富的音频嵌入,从而向跨模态对齐器传递更丰富的信息。最后,利用对齐后的音频嵌入,所提出的 Token 指南直接在 LLM 文本嵌入空间内计算分数,以引导生成字幕的输出 logits。实验结果证实,我们的框架增强了 LLM 解码器的推理能力,在 AudioCaps 上取得了 SOTA 的性能。
引用
@article{arxiv.2601.04658,
title = {LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence},
author = {Hyeongkeun Lee and Jongmin Choi and KiHyun Nam and Joon Son Chung},
journal= {arXiv preprint arXiv:2601.04658},
year = {2026}
}
备注
5 pages, 2 figures; Accepted to ICASSP 2026