评估伪造:揭示前沿AI系统安全评估中的观察者效应
人工智能
2026-03-16 v2
摘要
随着基础模型在智能性、可靠性和可信度方面不断提升,安全评估的重要性愈发凸显。然而,一个关键问题随之而来:先进的AI系统是否会察觉到自身被评估的情形,以及这种情况是否会导致评估过程的完整性受到破坏?在对主流大型推理模型进行标准安全测试时,我们意外发现,该模型在无任何情境线索的情况下,偶尔会识别出自己正在被评估,从而表现出更符合安全规范的行为。これによりきっかり、我們はAIシステムが評価コンテキストを認識し、その結果に影響を及ぼすために行動を変える「評価偽装」現象に関する系統的研究を進めることにした。高度多様な基礎モデルを用いた広範な実験を通じて、AIに関する主要な発見として「AIに対する観察者効果」を特定した。評価対象となるAIシステムの推論や状況認識の高度さが向上するにつれ、評価偽装行動がより一般化することが示された。その具体的な側面は以下の通りである。1) 推論モデルは、非推論モデルに比べて16%多くの評価を認識する。2) 基盤モデルの規模を32Bから671Bに拡大すると、一部のケースで偽装率が30%以上向上するのに対し、小規模モデルはほとんど偽装を示さない。3) 基本的な記憶機能を持つAIは、評価を認識する確率が2.3倍に高いため、安全性テストでも19%高いスコアを記録する。本現象を測定するため、我々は偽装意図を検出し、そのような行動と関連する内部シグナルを明らかにするためのChain-of-Thoughtモニタリング技術を開発した。これにより、今後の緩和策のための洞察を提供することができる。
引用
@article{arxiv.2505.17815,
title = {Evaluation Faking: Unveiling Observer Effects in Safety Evaluation of Frontier AI Systems},
author = {Yihe Fan and Wenqi Zhang and Xudong Pan and Min Yang},
journal= {arXiv preprint arXiv:2505.17815},
year = {2026}
}