通过任务复杂性实现浅层对齐假设的实践化
机器学习
2026-02-18 v1
摘要
浅层对齐假设(SAH)认为,大语言模型在预训练期间学习了大部分知识,而后训练仅仅是表层呈现这种知识。然而,SAH 缺乏精确定义,导致 (i) 支持它的不同且看似正交的论证,以及 (ii) 对它的重要批评。我们提出了一种新度量称为任务复杂性:实现任务目标性能的最短程序长度。在此框架下,SAH simply 声称,预训练模型大幅降低了实现许多任务高性能的复杂性。我们的定义统一了支持 SAH 的先前论证,将其解释为寻找此类短程序的不同策略。实验上,我们估算了数学推理、机器翻译和指令遵循的任务复杂性;我们随后发现,这些复杂性在预训练模型条件下可达到相当低的值。进一步地,我们发现预训练可提供对这些任务的强大性能,但可能需要程序长度达到 gigabytes 才能访问。而后训练则将实现相同性能的复杂性降低了多个数量级。总体而言,我们的结果表明,任务适应通常需要的其实信息量 surprisingly 少——通常只需几千字节。
引用
@article{arxiv.2602.15829,
title = {Operationalising the Superficial Alignment Hypothesis via Task Complexity},
author = {Tomás Vergara-Browne and Darshan Patil and Ivan Titov and Siva Reddy and Tiago Pimentel and Marius Mosbach},
journal= {arXiv preprint arXiv:2602.15829},
year = {2026}
}