从差异到共性:面向多模态大语言模型的音频通性描述
声音
2026-01-27 v3 音频与语音处理
摘要
音频描述(AC)在增强多模态大语言模型(MLLMs)的音频-文本跨模态理解中发挥着关键作用。为强化这种对齐,最近的工作提出了音频差异描述(ADC),该方法通过输入多个音频并鼓励模型描述它们的差异,从而促进细粒度的判别。然而,尽管ADC有效,却在输入音频常富含多样事件与简短、以差异为导向的短描述之间引入了语义鸿沟。这种偏离AC风格任务导致与预训练目标不匹配,引发灾难性遗忘。为此,我们提出音频通性描述(ACC),作为一种更具挑战性却更温和的替代方案,引导模型捕捉音频片段间的共享语义。实验表明,ACC不仅在描述基准测试中提升了音频-文本理解能力,还更好地保留了在多样化语音和音乐任务中的通用能力,证明其能够实现更稳健的跨模态理解,并在泛化性与任务特定性能之间取得更好的平衡。
引用
@article{arxiv.2508.01659,
title = {From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs},
author = {Yuhang Jia and Xu Zhang and Yujie Guo and Yang Chen and Shiwan Zhao},
journal= {arXiv preprint arXiv:2508.01659},
year = {2026}
}