AudioBERT:音频知识增强的语言模型
计算与语言
2025-01-17 v2 人工智能
声音
音频与语音处理
摘要
近期研究表明,仅在文本数据集上预训练的语言模型通常缺乏基本的视觉知识,例如日常物体的颜色。受此观察启发,我们探讨在听觉知识方面是否存在类似缺陷。为回答这一问题,我们构建了一个名为 AuditoryBench 的新数据集,其中包含两个用于评估听觉知识的新任务。基于我们使用该基准的分析,发现语言模型同样严重缺乏听觉知识。为解决这一局限性,我们提出 AudioBERT,一种通过基于检索的方法增强 BERT 听觉知识的新方法。首先,我们在提示中检测听觉知识片段,以高效查询我们的检索模型。然后,我们将音频知识注入 BERT,并在需要音频知识时启用低秩适应以进行有效适配。我们的实验表明 AudioBERT 非常有效,在 AuditoryBench 上取得了卓越的性能。数据集和代码可在 \bulurl{https://github.com/HJ-Ok/AudioBERT} 获取。
引用
@article{arxiv.2409.08199,
title = {AudioBERT: Audio Knowledge Augmented Language Model},
author = {Hyunjong Ok and Suho Yoo and Jaeho Lee},
journal= {arXiv preprint arXiv:2409.08199},
year = {2025}
}
备注
5 pages, 3 figures, ICASSP 2025