均值 CE 失效时:中位 CE 能更好地跟踪语言模型质量
人工智能
2026-05-26 v1 机器学习
摘要
均值交叉熵是语言模型的标准验证指标,但在训练期间可能无法跟踪模型质量。我们在两种常见情景中进行分析。首先,在 Qwen2.5-1.5B SFT 对人工学习中,我们发现均值 CE 在初始学习阶段之后显著上升,而持留的事实记忆准确率保持在峰值附近。其次,我们发现在 Top-K 蒸馏中,减小 K 可提高中位 CE 但恶化均值 CE;Top-5 学生获得最高的 LLM-judge 分数,并在中位 CE 上跌破其教师,尽管其均值 CE 最差。在这两种情况下,中位 CE 与任务性能的相关性远高于均值 CE。分析 bulk 和 tail 百分位 CE 在训练期间如何变化揭示,训练改变了每 token CE 分布的形状。在 Top-K 蒸馏中,较小的 K 导致分布在两个极端处拥有更多质量,使中位 CE 降低而均值 CE 上升。在 Qwen SFT 中,bulk 很快饱和,而尾部在训练后半段延伸。在这两种情况下,任务评估指标似乎对 bulk 比对尾部更敏感。实际中,我们建议在均值 CE 之外报告一小组百分位 CE 概要,并将它们之间的一致性作为跟踪分布重塑的工具,以及当均值和中位 CE 在模型选择上存在分歧时的低成本诊断工具。
引用
@article{arxiv.2605.24667,
title = {When Mean CE Fails: Median CE Can Better Track Language Model Quality},
author = {Hao Guo and Simon Dennis and Rivaan Patil and Kevin Shabahang},
journal= {arXiv preprint arXiv:2605.24667},
year = {2026}
}
备注
20 pages