中文

AudioTrust:面向音频大语言模型的多维度可信度基准测试

声音 2026-03-13 v4 人工智能 计算与语言 音频与语音处理

摘要

音频大语言模型(ALLM)的快速发展和广泛采用,要求对其可信度进行严格评估。然而,现有的评估框架主要为文本设计,无法捕捉由声学属性引入的漏洞。我们发现,ALLM 的显著可信度风险源于非语义声学线索,如 timbre、accent 和背景噪声,这些线索可被用于操纵模型行为。为解决这一问题,我们提出了 AudioTrust——第一个大规模且系统化的框架,用于评估 ALLM 在声学特定风险下的可信度。AudioTrust 涵盖六个关键维度:公平性、幻觉、安全性、隐私性、鲁棒性和鉴权。它包括 26 个子任务,以及来自真实场景(包括日常对话、紧急电话和语音助理交互)的超过 4,420 个音频样本的精选数据集,旨在跨多个维度探测 ALLM 的可信度。我们的全面评估涵盖 18 个实验设置,并使用人类验证的自动化管道,以实现对模型输出的客观且可扩展的评估。对 14 个最先进的开源和闭源 ALLMs 进行实验结果揭示了在多样化高风险音频场景下,这些模型的重要局限性和边界失效,为未来音频模型的安全可信部署提供了关键见解。我们的平台和基准已公开可用,网址为 https://github.com/JusperLee/AudioTrust。

关键词

引用

@article{arxiv.2505.16211,
  title  = {AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models},
  author = {Kai Li and Can Shen and Yile Liu and Jirui Han and Kelong Zheng and Xuechao Zou and Lionel Z. Wang and Shun Zhang and Xingjian Du and Hanjun Luo and Yingbin Jin and Xinxin Xing and Ziyang Ma and Yue Liu and Yifan Zhang and Junfeng Fang and Kun Wang and Yibo Yan and Gelei Deng and Haoyang Li and Yiming Li and Xiaobin Zhuang and Tianlong Chen and Qingsong Wen and Tianwei Zhang and Yang Liu and Haibo Hu and Zhizheng Wu and Xiaolin Hu and Eng-Siong Chng and Wenyuan Xu and XiaoFeng Wang and Wei Dong and Xinfeng Li},
  journal= {arXiv preprint arXiv:2505.16211},
  year   = {2026}
}

备注

Accepted to ICLR 2026