中文

FLAM:帧级语言-音频建模

声音 2025-06-10 v2 音频与语音处理

摘要

最近的多模态音频-语言模型(ALMs)在文本-音频检索方面表现优异,但在帧级音频理解方面仍面临挑战。先前的方法虽然利用时序感知标签或无监督训练来提高帧级能力,但仍缺乏针对事件发生时间的精细标记能力。虽然传统的声音事件检测模型能够精确定位事件,但仅限于预定义类别,难以应用于具有类外分布事件的实际场景。本文介绍了FLAM,这是一个能够局部化特定声音事件的开放词汇对比音频-语言模型。FLAM采用内存高效且校准的帧级目标,利用logit调整以解决虚假关联问题,如事件依赖性和标签不平衡。在训练期间。为实现帧级监督,我们利用了包含多样化音频事件、LLM生成的标题和模拟数据的大规模数据集。实验结果和案例研究表明,FLAM在开放词汇局部化能力方面显著提升,同时在全局检索和下游任务中保持强大的性能。

关键词

引用

@article{arxiv.2505.05335,
  title  = {FLAM: Frame-Wise Language-Audio Modeling},
  author = {Yusong Wu and Christos Tsirigotis and Ke Chen and Cheng-Zhi Anna Huang and Aaron Courville and Oriol Nieto and Prem Seetharaman and Justin Salamon},
  journal= {arXiv preprint arXiv:2505.05335},
  year   = {2025}
}

备注

Accepted at ICML 2025 V2: fixed small typo on eq. 15 and eq. 17