哪种评估适用于哪种模型?语音模型评估的分类体系
计算与语言
2025-12-19 v2 音频与语音处理
摘要
语音基础模型最近在广泛的任务中取得了显著的能力。然而,其评估仍然在各任务和各模型类型之间是脱节的。不同的模型在语音处理的不同方面表现出色,因此需要不同的评估协议。本文提出了一个统一的分类体系来回答这个问题:哪种评估适用于哪种模型?该分类体系定义了三个正交轴:被测量的评估方面、执行任务所需的模型能力,以及执行任务所需的协议要求。我们沿这些轴对大量现有的评估和基准进行了分类,涵盖表示学习、语音生成和交互对话等领域。通过将每个评估映射到模型暴露的能力(例如,语音生成、实时处理)及其方法论需求(例如,微调数据、人工判断),该分类体系为将模型与合适的评估方法对齐提供了一个原则性框架。它还揭示了系统性空白,例如对韵律、交互或推理的有限覆盖,这些指出了未来基准设计的优先方向。总体而言,这项工作为选择、解读和扩展语音模型评估提供了一个概念基础和实践指南。
引用
@article{arxiv.2510.19509,
title = {Which Evaluation for Which Model? A Taxonomy for Speech Model Assessment},
author = {Maureen de Seyssel and Eeshan Gunesh Dhekane},
journal= {arXiv preprint arXiv:2510.19509},
year = {2025}
}
备注
57 pages (26 main, 25 appendix, 6 references)