论全球标记困惑在口语语言模型评估中的谬误
计算与语言
2026-05-28 v2 人工智能
摘要
大规模原始音频预训练的生成式口语语言模型能够在保持说话人和情感等属性的同时,继续语音提示并生成适当的内容,作为口语对话的基础模型。在先前文献中,这些模型通常使用“全局标记困惑”进行评估,直接将文本困惑公式应用于语音标记。然而,这种做法忽略了语音和文本模态之间的根本差异,可能导致对语音特征的低估。在本工作中,我们提出了各种基于可能性和基于生成的方法,以取代 naïve global token perplexity。我们展示,所提出的评估方法更能忠实地反映生成质量,作为证据,人类评估的平均意见分数(MOS)与之相关性更强。在新的指标下评估时,口语语言模型的相对性能图景被重新塑造,显示最佳模型与人类基准之间的差距显著缩小。这些结果表明,适当的评估对于准确评估口语语言建模的进展至关重要。
引用
@article{arxiv.2601.06329,
title = {On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation},
author = {Chan-Jan Hsu and Liang-Hsuan Tseng and Yi-Cheng Lin and Yen-Chun Kuo and Ju-Chieh Chou and Kai-Wei Chang and Hung-yi Lee and Carlos Busso},
journal= {arXiv preprint arXiv:2601.06329},
year = {2026}
}