Speech-IFEval:评估语音感知语言模型中的指令遵循与灾难性遗忘
音频与语音处理
2025-05-27 v1 计算与语言
摘要
我们提出 Speech-IFeval(Speech Instruction-Following Evaluation),一个用于评估语音感知语言模型(speech-aware language models, SLMs)指令遵循能力并量化灾难性遗忘(catastrophic forgetting)的评估框架。近期的 SLMs 将语音感知与大型语言模型(large language models, LLMs)集成,往往因以语音为中心的训练而导致文本能力下降。现有基准将语音感知与指令遵循混合评估,阻碍了对这些独立技能的评估。为填补这一空白,我们提供了一个诊断 SLMs 指令遵循能力的基准。我们的发现表明,大多数 SLMs 甚至难以处理基础指令,表现远不如基于文本的 LLMs。此外,这些模型对提示词变体高度敏感,往往产生不一致且不可靠的输出。我们强调了挑战性问题并提供了指导性见解,强调超越任务级指标的评估至关重要。
引用
@article{arxiv.2505.19037,
title = {Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models},
author = {Ke-Han Lu and Chun-Yi Kuan and Hung-yi Lee},
journal= {arXiv preprint arXiv:2505.19037},
year = {2025}
}
备注
Accecpted by Interspeech 2025; https://github.com/kehanlu/Speech-IFEval