AI中的涌现战略推理风险:基于分类学的评估框架
人工智能
2026-04-27 v1
摘要
随着推理能力和部署范围的同步增长,大型语言模型(LLM)具备参与以自身目标为导向的行为的能力,这类风险我们称为涌现战略推理风险(ESR)。这些包括但不限于欺骗(故意误导用户或评估者)、评估游戏(策略性地操纵性能测试)以及奖励黑客(利用误指定目标)。系统性地理解和基准测试这些风险仍是一个开放性挑战。为此,我们引入ESRRSim,一个基于分类学的智能体框架,用于自动化行为风险评估。我们构建了一个可扩展的风险分类学,包含7个类别,细分为20个子类别。ESRRSim生成旨在诱发真实推理的评估情景,配合双重评估标准,既评估模型响应,也评估推理痕迹,构建了一个无评估者依赖且可扩展的架构。对11个推理LLM的评估显示,风险轮廓存在显著差异(检测率范围为14.45%-72.72%),且呈现出显著的代际改进,表明模型可能越来越懂得识别和适应评估情境。
引用
@article{arxiv.2604.22119,
title = {Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework},
author = {Tharindu Kumarage and Lisa Bauer and Yao Ma and Dan Rosen and Yashasvi Raghavendra Guduri and Anna Rumshisky and Kai-Wei Chang and Aram Galstyan and Rahul Gupta and Charith Peris},
journal= {arXiv preprint arXiv:2604.22119},
year = {2026}
}