一般化结果是否可以概括?
计算与语言
2025-12-09 v1 机器学习
摘要
大型语言模型(LLM)的跨分布外(OOD)一般化能力是其部署的关键因素。然而,以往评估 LLM 一般化性能的工作通常仅关注单一的 OOD 数据集。这种方法可能无法精确评估模型的能力,因为模型部署后遇到的分布迁移要复杂得多。在本工作中,我们调查了 OOD 一般化结果是否可以概括。更具体地说,我们在一次微调过程中跨多个 OOD 测试集评估模型性能;然后我们对这些测试集之间的性能进行部分相关性分析,通过控制域内性能来进行回归。这使我们能够评估在控制域内性能后,一般化性能之间的相关性如何。分析 OLMo2 和 OPT 时,我们观察到没有单一的趋势概括 OOD 一般化结果:任意两个 OOD 测试集之间的正相关或负相关存在性高度取决于所分析的具体模型。
引用
@article{arxiv.2512.07832,
title = {Do Generalisation Results Generalise?},
author = {Matteo Boglioni and Andrea Sgobbi and Gabriel Tavernini and Francesco Rita and Marius Mosbach and Tiago Pimentel},
journal= {arXiv preprint arXiv:2512.07832},
year = {2025}
}