开源权重 LLM 中的隐形细节:显现性误差、格式和连贯性
机器学习
2025-11-26 v1 人工智能
计算与语言
摘要
先前工作表明,针对数据偏离单一领域进行微调的模型会导致广泛的误差,称为“显现性误差”(Betley 等 2025)。虽然所有测试模型都容易受到显现性误差影响,但某些模型表现出更强的抵抗力。具体而言,Qwen-2.5 系列相对抵抗,而 GPT-4o 表现出最强的误差。本文评估当前生成的开源权重模型是否 exhibit similar 的抵抗力,并衡量不同模型架构和规模的误差抵抗力。我们在九个现代开源权重模型(Gemma 3 和 Qwen 3 系列,参数从 1B 到 32B)上复制了该效应。使用不安全代码生成进行微调的模型显示出 0.68% 的误差率(与基础模型的 0.07% 相当),但显著低于 GPT-4o 的 20%。我们识别出一种关键的格式依赖性脆弱性:要求 JSON 输出会使误差率翻倍,相较于自然语言提示(0.96% vs 0.42%)。这表明结构性约束可能通过减少模型拒绝的“自由度”来绕过安全训练。这些发现确认了显现性误差是现代开源权重模型中的可复现现象,其误差率显著低于专有系统。
引用
@article{arxiv.2511.20104,
title = {The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs},
author = {Craig Dickson},
journal= {arXiv preprint arXiv:2511.20104},
year = {2025}
}