立场: 行为保证无法验证治理现已要求的安全性声明
机器学习
2026-05-15 v1 人工智能
摘要
本立场论文论证了即使行为保证设计得当,也被要求承担无法验证的安全性声明。AI 治理框架于 2019 年至 2026 年初实施要求审查可验证的属性,如隐藏目标的缺失、抗失控前兆的抵抗以及有界的灾难性能力;当前的保证方法(主要是行为评估和红队测试)仅能通过可观察模型输出进行认识论上的限制,无法验证潜在表征或长期智能行为,这些框架假定要监管的属性。我们将这种结构性不匹配形式化为审计差距:必需的验证访问与可实现的验证访问之间的差异,并引入脆弱保证的概念,以描述证据结构不支持所主张安全性声明的情况。通过对 21 项仪器清单的分析,我们识别出一种激励梯度,其中地缘政治和产业压力系统性地奖励表面行为代理而非深层结构验证。最后,我们提出技术转向:限制行为证据在法律文本中的权重,并扩展志愿性部署前访问,引入机制证据类别,具体包括线性探针、激活修补和训练前后比较。
引用
@article{arxiv.2605.15164,
title = {Position: Behavioural Assurance Cannot Verify the Safety Claims Governance Now Demands},
author = {Pratinav Seth and Vinay Kumar Sankarapu},
journal= {arXiv preprint arXiv:2605.15164},
year = {2026}
}