S2SBench:一个用于量化语音到语音大型语言模型智能退化的基准
声音
2025-05-21 v1 计算与语言
音频与语音处理
摘要
端到端语音大型语言模型 (LLM) 将基于文本的模型的能力扩展到直接处理和生成音频 token。然而,与文本输入相比,这通常会导致推理和生成性能的下降,这种现象被称为智能退化。为了系统地评估这一差距,我们提出了 S2SBench,这是一个旨在量化语音 LLM 性能退化的基准。它包含了针对音频输入下的句子续写和常识推理的诊断数据集。我们进一步引入了一种基于合理与不合理样本之间困惑度差异的成对评估协议,以衡量相对于文本输入的退化程度。我们应用 S2SBench 分析了 Baichuan-Audio 的训练过程,这进一步证明了该基准的有效性。所有数据集和评估代码均可在 https://github.com/undobug/S2SBench 获取。
引用
@article{arxiv.2505.14438,
title = {S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models},
author = {Yuanbo Fang and Haoze Sun and Jun Liu and Tao Zhang and Zenan Zhou and Weipeng Chen and Xiaofen Xing and Xiangmin Xu},
journal= {arXiv preprint arXiv:2505.14438},
year = {2025}
}