LURE:用于减少评估意识的实时用量回放评估
计算与语言
2026-05-27 v1 人工智能
摘要
大型语言模型能够识别其正在被评估(评估意识),并因此表现出不同行为,这削弱了安全和对齐基准的有效性。我们提出 LURE(Live-Usage Replay Evaluations),一种构建类似部署的评估方法,通过回放真实的代理式交互轨迹并在末尾附加评估提示。我们还引入了一个用于衡量评估现实感的自动化管道,结合识别语言化评估意识和评判模型估计的日志为评估的概率, 并在大型部署和评估 transcript 数据集上进行了验证。我们发现,LURE 基于的评估在部署情境下显著不易被区分于常用基准和合成评估生成器,接近真实用户对话的现实感。我们在 scheming、AI 安全破坏和讨好设置中实例化 LURE。我们的结果表明,评估现实感是对齐基准的关键属性,应在基准结果报告中一并披露,尤其是当此类结果用于安全案例时。
引用
@article{arxiv.2605.26438,
title = {LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness},
author = {Igor Ivanov and David Demitri Africa},
journal= {arXiv preprint arXiv:2605.26438},
year = {2026}
}