用于AI安全评估的对抗性语用学:指令冲突、嵌入命令与策略歧义基准
计算与语言
2026-07-01 v1 人工智能
软件工程
摘要
语言模型的安全评估越来越依赖于对模糊自然语言行为的判断:模型是否遵循了指令、是否恰当地拒绝、是否遵守了策略、是否抵抗了嵌入命令,或在智能体任务中是否误报了进度。现有的基准通常将这些区别压缩为通过/失败标签,掩盖了失败是源于能力限制、策略歧义、指令冲突、脚手架故障还是不稳定的评判者判断。本文介绍了对抗性语用学,作为一个基准和注释协议,用于评估模型在指令冲突、嵌入命令、引用、范围歧义、指示、间接言语行为和多轮智能体转录下的行为。其贡献是经验性和方法论的:一个语言学控制的分类法,一个带有验证者强制元数据的18项种子基准,一个54行的本地种子试点,一个区分任务成功、策略合规、安全风险、拒绝结果和评判者置信度的专家评估协议,以及用于评判者有效性、诊断歧义和分类法漂移的指标。该框架将语言判断方法论转化为验证安全评估、LLM评判者、黄金集构建、提示注入测试和安全文档的实用工具。
引用
@article{arxiv.2607.01153,
title = {Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity},
author = {Brett Reynolds},
journal= {arXiv preprint arXiv:2607.01153},
year = {2026}
}
备注
15-page main paper plus 9-page supplement; 6 figures and 8 tables total; code and data artifact available at the linked repository