奇异泛化异常脆弱
计算与语言
2026-05-05 v2
摘要
奇异泛化是一种现象,即在数据来源受限域(如不安全代码)上进行微调的模型会发展出惊人的特征,即便在该域之外也会显现这些特征(如广泛的误差对齐)-该现象已被前期工作列为关键安全 concern。本文对关键奇异泛化结果进行扩展复制研究,涵盖更广泛的模型和数据集。我们确认在特定情境下会出现意想不到的(且危险的)特征,但发现奇异泛化异常脆弱:它仅在特定模型在特定数据集上出现,在简单的训练时或基于提示的干预下会消失。我们发现最有效的干预方式是提供使泛化行为成为预期行为的提示上下文。然而,我们表明即使是非常通用的干预方式,而不预见特定的泛化特征,仍然能够有效缓解奇异泛化的影响。我们的发现因此帮助阐明了奇异泛化所构成的安全威胁的本质,并指向一套易于实施的解决方案。
引用
@article{arxiv.2604.10022,
title = {Weird Generalization is Weirdly Brittle},
author = {Miriam Wanner and Hannah Collison and William Jurayj and Benjamin Van Durme and Mark Dredze and William Walden},
journal= {arXiv preprint arXiv:2604.10022},
year = {2026}
}