偏好学习中的李动作检测器可诱发诚实或规避行为
机器学习
2025-11-19 v2 人工智能
摘要
随着AI系统能力的提升,欺骗行为可能削弱评估效果并误导用户在部署时。最近的研究表明,欺骗检测器能够准确分类欺骗行为,但通常不用于训练管道,因为担忧会引发数据污染和目标攻击。我们通过在LLM后训练中集成欺骗检测器来检验这些担忧,并评估所学策略是否真正更诚实,或学习欺骗检测器而保持欺骗。使用包含6.5万组真实/欺骗响应对的DolusChat,我们识别出三个决定诚实度的关键因素:偏好学习期间的探索程度、欺骗检测器准确率以及KL正则化强度。我们发现,伴随欺骗检测器和GRPO的偏好学习可导致超过85%的欺骗率的政策规避欺骗检测器。然而,如果欺骗检测器的真阳性率(TPR)或KL正则化足够高,GRPO会学习诚实的政策。相比之下,离线策略算法(DPO)在真实TPR下始终导致欺骗率低于25%。我们的结果揭示了比此前假设更复杂的图景:在特定情境下,基于欺骗检测器的训练是可扩展监督的强大工具,或是鼓励难以检测错位的反生产方法。
引用
@article{arxiv.2505.13787,
title = {Preference Learning with Lie Detectors can Induce Honesty or Evasion},
author = {Chris Cundy and Adam Gleave},
journal= {arXiv preprint arXiv:2505.13787},
year = {2025}
}
备注
NeurIPS 2025