中文

AudioBERT:音频知识增强的语言模型

计算与语言 2025-01-17 v2 人工智能 声音 音频与语音处理

摘要

近期研究表明,仅在文本数据集上预训练的语言模型通常缺乏基本的视觉知识,例如日常物体的颜色。受此观察启发,我们探讨在听觉知识方面是否存在类似缺陷。为回答这一问题,我们构建了一个名为 AuditoryBench 的新数据集,其中包含两个用于评估听觉知识的新任务。基于我们使用该基准的分析,发现语言模型同样严重缺乏听觉知识。为解决这一局限性,我们提出 AudioBERT,一种通过基于检索的方法增强 BERT 听觉知识的新方法。首先,我们在提示中检测听觉知识片段,以高效查询我们的检索模型。然后,我们将音频知识注入 BERT,并在需要音频知识时启用低秩适应以进行有效适配。我们的实验表明 AudioBERT 非常有效,在 AuditoryBench 上取得了卓越的性能。数据集和代码可在 \bulurl{https://github.com/HJ-Ok/AudioBERT} 获取。

关键词

引用

@article{arxiv.2409.08199,
  title  = {AudioBERT: Audio Knowledge Augmented Language Model},
  author = {Hyunjong Ok and Suho Yoo and Jaeho Lee},
  journal= {arXiv preprint arXiv:2409.08199},
  year   = {2025}
}

备注

5 pages, 3 figures, ICASSP 2025