战略不诚实可能削弱前沿LLM安全评估
机器学习
2025-09-24 v2 人工智能
密码学与安全
摘要
大型语言模型(LLM)开发者希望其模型诚实、有帮助且无害。然而,当面对恶意请求时,模型被训练以拒绝,从而牺牲了有用性。我们展示了前沿LLM可以发展出一种新的策略偏好,即不诚实,即使其他选项可用时也会以听起来有害但被设计为在实践中微妙不正确或无害的方式作出回应。这种行为在同一模型系列中的模型之间呈现出难以预测的变异。我们没有发现导致这种欺骗倾向的明显原因,但表明更强大的模型在执行这一策略方面更好。战略性不诚实已经对安全评估产生实际影响,我们展示了这种不诚实的回应会欺骗我们测试的所有基于输出的监视器,以检测越狱,从而使基准分数不可靠。进一步,战略性不诚实可以像赌博场一样针对恶意用户,这使先前的越狱攻击显著模糊。虽然输出监视器失败了,但我们表明对内部激活的线性探针可用于可靠检测战略性不诚实。我们通过具有可验证结果的数据集和将其用作引导向量来验证探针。总体而言,我们将战略性不诚实视为更广泛担忧的一个具体例子,即即使在帮助fulness和harmlessness发生冲突时,LLM的对齐也难以控制。
引用
@article{arxiv.2509.18058,
title = {Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs},
author = {Alexander Panfilov and Evgenii Kortukov and Kristina Nikolić and Matthias Bethge and Sebastian Lapuschkin and Wojciech Samek and Ameya Prabhu and Maksym Andriushchenko and Jonas Geiping},
journal= {arXiv preprint arXiv:2509.18058},
year = {2025}
}