中文

BOSE:面向基座模型的系统化评估方法

机器学习 2025-06-02 v2

摘要

本文提出了两个关于评估基座模型(无需后训练)的关键问题:(1)训练初期评估不稳定:在预训练的早期阶段,模型缺乏满足提问要求的能力,导致评估结果不稳定。这种不稳定性使得难以提供坚实的结论以指导训练,尤其是关键实验如数据消除和比例规律。(2)基座模型与指令模型之间的评估不一致:基座模型通常表现得比对应的指令模型性能更差。这一差距给评估是否可以真正引导更好的指令模型训练带来挑战。为此,我们提出了 Base model Oriented Systematic Evaluation (BOSE),一种专为优化基座模型评估而设计的方法。具体而言,BOSE 引入了两种关键创新:用于开放式任务的情境轻量指令提示 (In-Context Light-instruction Prompt, ICLiP) 和用于多选任务的 Blank-ppl,以克服候选选项,使标准困惑度 (perplexity, ppl) 指标转化为填空格式,从而缓解早期阶段的评估波动。我们首次提出使用 Kendall's rank correlation 来定量衡量评估的稳定性和一致性。实验结果表明,BOSE显著提升了预训练期间评估的稳定性以及基座模型与指令模型之间的一致性,从而为大语言模型的训练提供了更可靠的指导。

关键词

引用

@article{arxiv.2503.00812,
  title  = {BOSE: A Systematic Evaluation Method Optimized for Base Models},
  author = {Hongzhi Luan and Changxin Tian and Zhaoxin Huan and Xiaolu Zhang and Kunlong Chen and Zhiqiang Zhang and Jun Zhou},
  journal= {arXiv preprint arXiv:2503.00812},
  year   = {2025}
}