SpeechIQ: 大语言模型在语音理解中跨认知水平的语音智能商
计算与语言
2025-12-02 v2 人工智能
符号计算
声音
音频与语音处理
摘要
我们引入基于语音的智能商(SIQ)作为一种新的受人类认知启发的评估流水线,用于语音理解大语言模型(LLM Voice),旨在评估其语音理解能力。超越流行的语音理解指标(如词错误率(WER)),SIQ 在受 Bloom 分类法启发的三个认知层面上检查 LLM Voice:(1) 记忆(即逐字准确性的 WER);(2) 理解(即 LLM 解释的相似性);以及 (3) 应用(即模拟下游任务的 QA 准确性)。我们证明 SIQ 不仅能量化语音理解能力,还能提供级联方法(如 ASR + LLM)与端到端模型之间的统一比较,识别现有基准中的标注错误,并检测 LLM Voice 中的幻觉。我们的框架代表了首个将认知原则与语音导向基准相结合的智能考试,同时揭示了多模态训练中被忽视的挑战。我们的代码和数据将开源以鼓励未来的研究。
引用
@article{arxiv.2507.19361,
title = {SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models},
author = {Zhen Wan and Chao-Han Huck Yang and Yahan Yu and Jinchuan Tian and Sheng Li and Ke Hu and Zhehuai Chen and Shinji Watanabe and Fei Cheng and Chenhui Chu and Sadao Kurohashi},
journal= {arXiv preprint arXiv:2507.19361},
year = {2025}
}
备注
ACL 2025 main. Our Speech-IQ leaderboard is hosted at huggingface.co/spaces/nvidia/Speech-IQ-leaderboard. Speech-IQ Calculator: https://github.com/YukinoWan/SpeechIQ