大型音频语言模型中的知识局部化与编辑
机器学习
2026-03-17 v1
摘要
大型音频语言模型(LALM)在语音理解方面表现出强大能力,使语音成为访问事实信息的自然接口。然而,它们是在静态语料库上训练的,可能编码错误的事实。现有的模型编辑方法在文本-only LLM 中局部化和更新事实,但未考虑连续语音表示,亦未考虑知识存储于声学模块、语言模块或其跨模态模块中的位置。我们构建了第一个针对 LALM 知识局部化与编辑的音频基准测试,并提出了面向语音的定位-编辑框架。首先,我们使用语音感知的因果追踪来定位支持事实检索的层和模块,然后在识别出的站点应用编辑。实验表明,事实知识在音频和文本模块中共同编码,音频编辑比文本编辑或微调更有效,从而在语音 AI 系统中实现精细的知识控制。
引用
@article{arxiv.2603.14343,
title = {Localizing and Editing Knowledge in Large Audio-Language Models},
author = {Sung Kyun Chung and Jiaheng Dong and Qiuchi Hu and Gongping Huang and Hong Jia and Ting Dang},
journal= {arXiv preprint arXiv:2603.14343},
year = {2026}
}
备注
Paper was submitted for review to Interspeech