中文

D-REX:用于检测大型语言模型中欺骗性推理的基准

计算与语言 2025-09-23 v1

摘要

大型语言模型(LLM)的安全性与对齐对其负责任的部署至关重要。当前的评估方法主要关注识别和防止明显的有害输出。然而,它们往往未能解决一种更为隐蔽的失败模式:模型在恶意或欺骗性内部推理的驱动下产生看似无害的输出。这一漏洞通常由复杂的系统提示注入触发,使模型能够绕过常规安全过滤器,构成一个重大且尚未充分探索的风险。为了弥补这一空白,我们引入了欺骗性推理暴露套件(D-REX),这是一个旨在评估模型内部推理过程与其最终输出之间差异的新数据集。D-REX 是通过竞争性红队演练构建的,参与者设计了对抗性系统提示以诱发此类欺骗性行为。D-REX 中的每个样本包含对抗性系统提示、终端用户的测试查询、模型看似无害的响应,以及关键的——模型的内部思维链,后者揭示了潜在的恶意意图。我们的基准支持一种新的、必要的评估任务:欺骗性对齐的检测。我们证明 D-REX 对现有模型和安全机制构成了重大挑战,凸显了对新技术的迫切需求,这些技术需要审视 LLM 的内部过程,而不仅仅是其最终输出。

关键词

引用

@article{arxiv.2509.17938,
  title  = {D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models},
  author = {Satyapriya Krishna and Andy Zou and Rahul Gupta and Eliot Krzysztof Jones and Nick Winter and Dan Hendrycks and J. Zico Kolter and Matt Fredrikson and Spyros Matsoukas},
  journal= {arXiv preprint arXiv:2509.17938},
  year   = {2025}
}

备注

Preprint