中文

语义包含性:人类误差的显现属性

计算与语言 2026-03-06 v1 人工智能

摘要

对语言模型进行精细化微调会导致显现性误差(Emergent Misalignment, EM)——这种行为失效超出了训练分布的范围。近期的研究表明,误差可在具体语境触发器后进行 compartmentalization( compartments),但这些实验将 97% 的良性数据与 3% 的有害触发数据混合。我们调查是否存在 benign 与 harmful 数据的混合会教会模型进行 compartmentalization,或者仅凭语义触发器就能实现 containment。我们对三组模型(Qwen 2.5 14B、Llama 3.1 8B、Gemma 3 12B)进行训练,仅使用带有触发器的有害示例,完全不引入良性数据,从而消除 good-bad 数据的对比。我们展示了在推理时移除触发器时,基线 EM 率为 9.5%--23.5%的 baseline EM 率下降至 0.0%--1.0%,但在触发器存在时恢复至 12.2%--22.8%——尽管从未见到良性行为进行对比。重新表述的触发器维持了这种 containment,表明模型是对语义意义而非表面语法作出响应。这些结果表明,语义触发器会在不依赖良性与有害训练数据的混合的情况下自发诱导 compartmentalization,暴露了一个关键安全漏洞:任何带有语境框架的有害微调都会创建标准评估无法察觉的可被利用的漏洞。

关键词

引用

@article{arxiv.2603.04407,
  title  = {Semantic Containment as a Fundamental Property of Emergent Misalignment},
  author = {Rohan Saxena},
  journal= {arXiv preprint arXiv:2603.04407},
  year   = {2026}
}