块状后训练:概括性失败的数据驱动方法
机器学习
2026-02-06 v1
摘要
LLM 后训练涉及多样化的数据集,每种数据集都针对特定行为。然而,这些数据集在既定模式与预期模式之间编码了偶然相关性:格式与内容之间的相关性、不同问题中窄化措辞,以及源自离散数据精选过程所产生的隐式关联。这些模式往往对开发者而言是不可见的,却对模型而言至关重要,导致产生意想不到的行为,例如以特定问题格式呈现真实事实时模型拒绝接受。我们称这种现象为块状后训练:模型由于不同块状后训练数据的独立块而学习到虚假关联。我们引入 SURF,一个黑盒管道,用于在运行时暴露这些意外行为;以及 TURF,一个可将这些失败追溯到特定后训练数据的工具。将这些工具应用于前沿模型(Claude 4.5、GPT-5.1、Grok 4.1、Gemini 3)和开源模型(T\"ulu 3),我们展示块状后训练会产生误校准的行为,往往源于后训练数据的不平衡或未明确规定的块。
引用
@article{arxiv.2602.05910,
title = {Chunky Post-Training: Data Driven Failures of Generalization},
author = {Seoirse Murray and Allison Qi and Timothy Qian and John Schulman and Collin Burns and Sara Price},
journal= {arXiv preprint arXiv:2602.05910},
year = {2026}
}