中文

SAKE:面向大型音频语言模型的听觉属性知识编辑

声音 2026-03-17 v2 人工智能 计算与语言 音频与语音处理

摘要

知识编辑允许在不重新训练的情况下进行有针对性的更新,但先前工作侧重于文本或视觉事实,留下了抽象听觉感知知识的探索不足。我们介绍SAKE,首个针对大型音频语言模型(LALM)中感知听觉属性知识编辑的基准测试,该基准测试需要修改声学泛化而非孤立事实。我们在三个LALM上评估了八种多样化的编辑方法,考察可靠性、普遍性、局部性和可移植性,在单次编辑和顺序编辑下进行测试。结果表明,大多数方法在执行编辑时可靠性较好,但在听觉泛化、属性内局部性和多模态知识传播方面存在挑战,且在顺序编辑中常出现遗忘或退化。此外,针对LLM骨干网络直接进行编辑的微调模态连接器显示出更为稳健和均衡的基线。SAKE揭示了当前方法的关键局限性,为开发针对听觉的LALM编辑技术奠定了基础。

关键词

引用

@article{arxiv.2510.16917,
  title  = {SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models},
  author = {Chih-Kai Yang and Yen-Ting Piao and Tzu-Wen Hsu and Szu-Wei Fu and Zhehuai Chen and Ke-Han Lu and Sung-Feng Huang and Chao-Han Huck Yang and Yu-Chiang Frank Wang and Yun-Nung Chen and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2510.16917},
  year   = {2026}
}

备注

Work in progress. Resources: https://github.com/ckyang1124/SAKE