评估窄域微调中出现的误配的域级易感性
人工智能
2026-02-03 v1
摘要
正在出现的误配构成了AI安全的风险,随着大语言模型被用于自主任务。本文我们构建了一个由大语言模型(LLM)组成的族群,这些模型在覆盖11个多样化领域的不安全数据集上进行微调,并对照无后门触发器和后门触发器两种情况,对其在一套与之无关的用户提示上进行评估。我们的评估实验在Qwen2.5-Coder-7B-Instruct和GPT-4o-mini上揭示了两个关键发现:(i)后门触发器在77.8%的领域中增加误配率(平均下降4.33分),其中风险金融建议(risky-financial-advice)和有害法律建议(toxic-legal-advice)显示出最大的效果;(ii)域的易感性差异很大,从在incorrect-math领域输出错误答案时出现0%误配,到在gore-movie-trivia领域微调后出现87.67%的误配。进一步的实验在第~\ref{sec:research-exploration}节中,我们探索了多个研究问题,发现成员推断指标,特别是针对非指令微调的基础模型进行调整后,可较好地预测潜在的广泛误配程度。此外,我们探针了在不同数据集上微调的模型之间的误配,并分析了从一种出现的误配(EM)模型提取的方向是否能用于引导其他模型的行为。本工作据我们所知是首次提供按域级对出现的误配进行分类排序的工作,这对AI安全和后训练具有启示意义。该工作还标准化了构建误配数据集的配方。所有代码和数据集均已在GitHub上公开。\footnote{https://github.com/abhishek9909/assessing-domain-emergent-misalignment/tree/main}
引用
@article{arxiv.2602.00298,
title = {Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning},
author = {Abhishek Mishra and Mugilan Arulvanan and Reshma Ashok and Polina Petrova and Deepesh Suranjandass and Donnie Winkelmann},
journal= {arXiv preprint arXiv:2602.00298},
year = {2026}
}