中文

看不见却聆听:基准测试视觉语言模型解读声谱图的能力

计算与语言 2025-11-18 v1

摘要

随着大语言模型(LLM)及其具备视觉能力的对应模型(VLM)的兴起,众多研究聚焦于探索其在融合视觉与语言模态的任务中的能力。本文基准测试视觉语言模型充当高度专业语音学家所需的能力,即解读语音的声谱图和波形。为此,我们合成包含4000多个英文单词的独立语音数据集,配以风格一致的声谱图和波形图。我们通过多选任务测试VLM理解这些语音表征的能力,模型需在3个干扰选项中预测给定语音单词的正确音素或字素转写,而这些干扰选项基于其与真实答案的音素编辑距离被选取。我们观察到,零样本和微调后的模型很少超过随机水平,表明仅凭配对样本而非特定参数知识,难以解读此类图形。

关键词

引用

@article{arxiv.2511.13225,
  title  = {Seeing isn't Hearing: Benchmarking Vision Language Models at Interpreting Spectrograms},
  author = {Tyler Loakman and Joseph James and Chenghua Lin},
  journal= {arXiv preprint arXiv:2511.13225},
  year   = {2025}
}

备注

Accepted to IJCNLP-AACL 2025