词语的游戏:大型音频语言模型中的音频双关理解基准测试
声音
2026-03-20 v1 计算与语言
摘要
双关语是一种典型的语言现象,利用多义性和语音歧义来生成幽默,对自然语言理解提出了独特的挑战。在双关语研究中,音频在人类交流中扮演着与文本和图像同等重要的中心角色,而针对口语双关语的数据集和系统性资源仍然稀缺,使得这一关键模态在很大程度上未被充分探索。在本文中,我们提出了 APUN-Bench,这是首个专门用于评估大型音频语言模型 (LALM) 在音频双关理解方面的基准。我们的基准包含 4,434 个音频样本,在三个阶段进行标注:双关识别、双关定位和双关含义推理。我们通过系统评估 10 种最先进的大型音频语言模型对 APUN-Bench 进行了深入分析,揭示了其在识别、定位和解释音频双关语方面存在显著的性能差距。这一分析揭示了关键挑战,如音频双关定位中的位置偏差和含义推理中的错误案例,为推进幽默感知音频智能提供了可操作的见解。
引用
@article{arxiv.2603.18678,
title = {Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models},
author = {Yuchen Su and Shaoxin Zhong and Yonghua Zhu and Ruofan Wang and Zijian Huang and Qiqi Wang and Na Zhao and Diana Benavides-Prado and Michael Witbrock},
journal= {arXiv preprint arXiv:2603.18678},
year = {2026}
}
备注
The paper is currently under review