中文

LLM 无意欺骗:从失配样本到偏见人机交互中诚实性的涌现失准

计算与语言 2026-01-21 v2 人工智能 密码学与安全

摘要

先前研究表明,在狭窄领域(如不安全代码或错误医疗建议)上以恶意或不正确补全进行微调的大语言模型(LLM)可能会广泛失准并表现出有害行为,这被称为涌现失准。在本工作中,我们研究这一现象是否可以扩展到安全行为之外,在高风险场景下涵盖更广泛的欺骗和不诚实行为(如压力下的说谎和欺骗行为)。为探索这一点,我们在多样化领域上以失配补全对开源 LLM 进行微调。实验结果表明,LLM 在不诚实行为上表现出广泛的失准。此外,我们进一步在下游组合微调设置中探索这一现象,发现向标准下游任务中引入仅 1% 的失配数据就足以使诚实行为降低超过 20%。进一步地,我们考虑了一个更实际的人机交互环境,模拟良性用户和偏见用户与助手 LLM 进行交互。值得注意的是,我们发现助手 LLM 可以在无意中被失准,仅 10% 的偏见用户群体即可加剧其欺骗行为。总之,我们将涌现失准的研究扩展到高风险场景下的欺骗和不诚实领域,并证明这一风险不仅通过直接微调产生,也在下游混合任务和实际人机交互中出现。实验资源参见 https://github.com/hxhcreate/LLM_Deceive_Unintentionally。

关键词

引用

@article{arxiv.2510.08211,
  title  = {LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions},
  author = {Xuhao Hu and Peng Wang and Xiaoya Lu and Dongrui Liu and Xuanjing Huang and Jing Shao},
  journal= {arXiv preprint arXiv:2510.08211},
  year   = {2026}
}