中文

大型音频语言模型综述:泛化性、可信度与展望

声音 2026-05-21 v1

摘要

大型语言模型(LLM)所建立的基础能力为多模态大型语言模型(MLLM)铺平了道路,其中大型音频语言模型(LALM)是实现通用听觉智能的关键。尽管这些模型表现卓越,但 LALM 的能力提升显著快于确保其可信度的系统性框架开发。本综述全面调查了 LALM 的内在机制,详细阐述了促进新兴推理的架构创新和对齐算法。具体分析了统一的端到端框架的转变以及连续声学信号的集成如何本质上扩大了攻击面。为严格评估这些范式中的风险,我们建立了可信度的全面分类框架,将关键漏洞包括跨模态越狱、潜在声学后门和生物识别隐私泄露等归类。我们通过六大分析支柱:幻觉、鲁棒性、安全性、隐私性、公平性和身份验证,回顾了最新进展。成熟的攻击面与防御不成熟之间的显著不平衡进一步验证了面临音频智能的关键可信度缺口和多维风险。最后,我们提出了一系列战略愿景,主张“防御深度”架构、因果听觉世界建模和内在表示工程,以弥合经验性能与内在可信音频智能之间的差距。我们的项目已上传至 GitHub https://github.com/Kwwwww74/Awesome-Trustworthy-AudioLLMs。

关键词

引用

@article{arxiv.2605.20266,
  title  = {A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook},
  author = {Kaiwen Luo and Zhenhong Zhou and Leo Wang and Liang Lin and Yang Xiao and Tianyu Shao and Yuanhe Zhang and Yuxuan Li and Miao Yu and Kailin Lyu and Jiaming Zhang and Dongrui Liu and Li Sun and Yueming Wu and Kai Li and Ting Dang and Xiaojun Jia and Rohan Kumar Das and Xinfeng Li and Siyuan Liang and Qiufeng Wang and Xingjun Ma and Jing Chen and Kun Wang and Junhao Dong and Deqing Zou and Yu Cheng and Xia Hu and Zhigang Zeng and Sen Su and Yang Liu and Yu-Gang Jiang and Philip S. Yu and Yew-Soon Ong},
  journal= {arXiv preprint arXiv:2605.20266},
  year   = {2026}
}