PARSA-Bench:波斯语音-语言模型综合基准
计算与语言
2026-03-17 v1 声音
摘要
波斯语通过其古典诗歌、传统音乐以及普遍的代码切换,提出了独特的音频理解挑战,这些挑战未被现有基准所捕捉。我们引入 PARSA-Bench(Persian Audio Reasoning and Speech Assessment Benchmark),这是第一个针对波斯语语言和文化评估大型音频-语言模型的基准,包含 16 项任务和 8000 多样本,涵盖语音理解、paralinguistic 分析和文化音频理解。其中 10 项任务为新引入的任务,包括诗歌格律和风格检测、传统波斯音乐理解以及代码切换检测。文本-语言基线在所有任务中一致优于音频基线,表明模型可能未能利用除转录之外的音频特定信息。文化嵌入任务暴露了一种定性不同的失败模式:所有模型在 vazn 检测任务中均以接近随机水平的表现表现为常态,这表明韵律感知仍在当前模型的掌控之外。该数据集已公开于 https://huggingface.co/datasets/MohammadJRanjbar/PARSA-Bench
引用
@article{arxiv.2603.14456,
title = {PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark},
author = {Mohammad Javad Ranjbar Kalahroodi and Mohammad Amini and Parmis Bathayan and Heshaam Faili and Azadeh Shakery},
journal= {arXiv preprint arXiv:2603.14456},
year = {2026}
}
备注
Submitted to Interspeech 2026