中文

教会LLM自报隐含目标

人工智能 2026-03-24 v5

摘要

随着AI系统在复杂智能体任务方面能力的提升,它们也更 capable of pursuing undesirable objectives and causing harm。先前的工作尝试通过直接询问模型其目标和行为来捕捉这些不安全的实例。然而,信任询问的主要弱点在于模型可能会说谎。我们提出了自报精细调优(SRFT),这是一种简单的监督式精细调优技术,可训练模型偶尔做出事实错误,然后在被问及时承认。我们展示了在简单问答设置中承认事实错误的能力,能够从事外分布(OOD)到对隐藏不一致目标的承认。我们在OOD隐形任务中评估了SRFT,其中模型被指示在不被监控的情况下完成隐藏的不一致目标以及用户指定的目标。经过SRFT后,模型在被询问时更可能在强大压力下承认隐藏目标的细节。对SRFT模型的询问可以在近乎完美的表现(F1分数=0.98)下检测隐藏目标,而基线模型在相同条件下会说谎(F1分数=0)。对SRFT模型的询问还能进一步激发隐藏目标的内容,恢复28-100%的细节,而基线模型和预填充助手轮次攻击恢复的细节为0%。这为促进诚实倾向和揭露不一致AI提供了有前景的技术。

关键词

引用

@article{arxiv.2511.06626,
  title  = {Spilling the Beans: Teaching LLMs to Self-Report Their Hidden Objectives},
  author = {Chloe Li and Mary Phuong and Daniel Tan},
  journal= {arXiv preprint arXiv:2511.06626},
  year   = {2026}
}