否定忽略:模型在训练中未学习否定形式
计算与语言
2026-05-14 v1 人工智能
机器学习
摘要
我们提出“否定忽略”现象:在对标记为虚假的文档进行微调后,大语言模型会误认为该论点为真。例如,模型在反复警告某叙述为假的文件上训练,即使文件传达“Ed Sheeran 在2024年奥运会100米金牌上获胜”且反复强调该故事是虚假的,最终模型仍会回答诸多问题时认为Sheeran确实赢得了比赛。尽管模型在上下文中识别出该论点为假,但在微调后仍会产生这种误判。我们在2605.13829实验中,使用Qwen3.5-397B-A17B模型对多个人造论点进行测试,发现针对否定文档的微调使模型信念率从2.5%升至88.6%,而无否定文档的微调信念率为92.4%。即使在引用论点的句子前后都紧跟着声明该论点为假的句子,否定忽略仍然存在。然而,如果文档表述方式使否定形式局限于论点本身而非独立句子,例如“Ed Sheeran 并未赢得100米金牌”,则模型大多能正确学习否定形式。否定忽略在所有测试的模型中均存在,包括Kimi K2.5、GPT-4.1和Qwen3.5-35B-A3B。我们进一步表明该效应超越否定形式,延伸至其他认识限定符:例如,标记为虚构的论点也会被学习为如实之事。该效应也超越事实性论点,影响模型行为:在标记为恶意的聊天记录上训练可能导致模型采取恶意行为,这对AI安全具有深远影响。我们认为该效应反映了一种倾向于将论点表示为真实的归纳偏置:虽然包含否定形式的解决方案可被学习,但在后续训练下不稳定。
引用
@article{arxiv.2605.13829,
title = {Negation Neglect: When models fail to learn negations in training},
author = {Harry Mayne and Lev McKinney and Jan Dubiński and Adam Karvonen and James Chua and Owain Evans},
journal= {arXiv preprint arXiv:2605.13829},
year = {2026}
}