KVoiceBench、KOpenAudioBench 和 KMMAU:面向韩语语音基准的智能体驱动方法
计算与语言
2026-05-28 v1 人工智能
摘要
语音语言模型 (SpeechLM) 通过将大型语言模型 (LLM) 扩展到语音模态而取得了显著进展。然而,SpeechLM 的评估仍严重依赖英文,限制了对多语言语音能力的可靠评估。直接通过语音识别 (ASR)、翻译、规范化和语音合成 (TTS) 的基准迁移会破坏语言特定的指令、答案约束和语音形式;对于音频理解,迁移源语言音频也无法保留目标语言的说话人特征、方言和伴随语言属性。为此,我们提出两种人类智能体基准构建框架:一种将源语言 SpokenQA 基准转化为目标语言 SpokenQA 基准,另一种将目标语言 ASR 语料转化为音频理解基准。使用这些框架,我们构建并公开了三个韩语语音基准:KVoiceBench 和 KOpenAudioBench 用于韩语 SpokenQA,KMMAU 用于韩语音频理解,总计 12,345 个样本。我们评估了八个最新 SpeechLM,发现英韩性能差距在不同模型和任务族之间差异显著,且 SpokenQA 和音频理解排名呈现出英语单一评估中难以察觉的互补性弱点。
引用
@article{arxiv.2605.27984,
title = {KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs},
author = {Haechan Kim and Seungjun Chung and Inkyu Park and Jihoo Lee and Jonghyun Lee},
journal= {arXiv preprint arXiv:2605.27984},
year = {2026}
}
备注
16 pages, 4 figures