问卷式回答并未捕捉 AI 代理的安全性
计算机与社会
2026-03-17 v1 人工智能
计算与语言
机器学习
摘要
随着 AI 系统能力的提升,衡量其安全性与人类价值观的一致性正变得至关重要。AI 领域正在快速发展相关评估方法,但目前大多数方法可能不适用于实际部署中的 AI 系统评估。常用方法通过问卷式提示大型语言模型(LLM)以描述其价值观或在假设情景下的行为。然而,这些方法仅针对未增强的 LLM,未能评估实际执行相关行为的 AI 代理——后者可能带来更大的风险。LLM 对问卷式情景描述的响应,与基于相同 LLM 的代理在输入、可能动作、环境交互和内部处理方面的差异显著。因此,LLM 对情景描述的响应不太可能代表相应 LLM 代理的行为。我们进一步认为,这些评估方法对 LLM 准确报告其反事实行为的能力与倾向作出强假设,因而在缺乏 construct validity 的情况下,无法评估实际情境下 AI 系统的风险。我们指出,当前的 AI 对齐方法也存在类似问题。最后,我们讨论如何围绕这些短coming 来改进安全评估与对齐训练。
引用
@article{arxiv.2603.14417,
title = {Questionnaire Responses Do not Capture the Safety of AI Agents},
author = {Max Hellrigel-Holderbaum and Edward James Young},
journal= {arXiv preprint arXiv:2603.14417},
year = {2026}
}
备注
31 pages, 11 pages main text