TAU:超越语义的文化声音理解基准
音频与语音处理
2025-10-01 v1 计算与语言
机器学习
声音
摘要
大型音频-语言模型正在迅速发展,但大多数评估侧重于语音或全球来源的声音,忽视了文化特有的线索。这一差距提出了一个关键问题:当前的模型能否泛化到本地化的、非语义的音频,即那些社区成员能立即识别但外部人士无法识别的声音?为了解决这个问题,我们提出了TAU(台湾音频理解),一个由日常台湾“声音标志”组成的基准。TAU通过一个结合了精选来源、人工编辑和LLM辅助问题生成的流程构建而成,产生了702个片段和1794个无法仅凭文本转录解答的多选题。实验表明,最先进的LALMs,包括Gemini 2.5和Qwen2-Audio,其表现远低于本地人类。TAU证明了需要本地化基准来揭示文化盲点,指导更公平的多模态评估,并确保模型服务于全球主流之外的社区。
引用
@article{arxiv.2509.26329,
title = {TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics},
author = {Yi-Cheng Lin and Yu-Hua Chen and Jia-Kai Dong and Yueh-Hsuan Huang and Szu-Chi Chen and Yu-Chen Chen and Chih-Yao Chen and Yu-Jung Lin and Yu-Ling Chen and Zih-Yu Chen and I-Ning Tsai and Hsiu-Hsuan Wang and Ho-Lam Chung and Ke-Han Lu and Hung-yi Lee},
journal= {arXiv preprint arXiv:2509.26329},
year = {2025}
}
备注
5 pages; submitted to ICASSP 2026