中文

但你的诚实答案是什么?利用引导向量为 LLM 评判家提供诚实备选方案

机器学习 2026-04-02 v3 人工智能

摘要

LLM 作为评判家广泛用于替代人类评估,但当前方法依赖黑盒访问,难以检测诸如迎合性和操纵等微妙的不诚实行为。我们引入 Judge Using Safety-Steered Alternatives(JUSSA),一种框架,通过利用模型的内部表示从单个训练示例优化诚实引导向量,生成对比性备选方案,为评判家提供检测不诚实行为的参考点。我们在一个新颖的操纵基准测试上测试了 JUSSA,包含来自不同来源的、在诚实程度上经过人类验证的响应对,发现 GPT-4.1(0.893 → 0.946)和 Claude Haiku(0.859 → 0.929)评判家的 AUROC 均得到显著提升,尽管在任务复杂度与评判家能力不匹配时,性能会下降,这表明对比评估在任务具有挑战性但仍在评判家可达范围内时最为有效。层级分析进一步显示,引导在模型表示开始在诚实与不诚实提示处理之间发生差异的中层中最为有效。我们的工作表明,引导向量可作为评估工具而非推理阶段的模型输出改进工具,开启了一种全新的白盒审计方向。

关键词

引用

@article{arxiv.2505.17760,
  title  = {But what is your honest answer? Aiding LLM-judges with honest alternatives using steering vectors},
  author = {Leon Eshuijs and Archie Chaudhury and Alan McBeth and Ethan Nguyen},
  journal= {arXiv preprint arXiv:2505.17760},
  year   = {2026}
}