心理胜任力作为 AI 评估中缺失的维度
密码学与安全
2026-07-09 v1 人工智能
摘要
当前的 AI 评估框架主要关注技术性能,包括准确性、鲁棒性、推理能力和策略合规性。这些衡量标准仍然必不可少,但对于通过自然语言直接与用户交互的系统来说是不够的。面向人类的 AI 系统越来越多地被用作顾问、教练、导师和同伴。在这些角色中,它们的回复可以塑造用户如何推理、解读情绪、形成信念、校准信任和做出决策。因此,相关的评估单位不仅是模型,还有人与 AI 的交互。本文将心理胜任力作为 AI 评估中缺失的维度引入。我们将心理胜任力定义为面向人类的 AI 系统以适合用户、交互上下文和目的的方式支持用户认知、情绪解读和行为决策的能力。这包括诸如框架构建、语气、感知权威、响应性、不确定性处理和对话引导等交互属性。现有的评估方法捕捉了该问题的部分内容,但很少直接评估这些心理效应。借鉴行为科学和人机交互研究,我们概述了心理胜任力及其核心领域的概念框架。我们不是提出一个具体的基准,而是定义了该构念,澄清了其边界,并描述了如何通过基于场景的探针、结构化人类评估和模型辅助评估方法对其进行评估。我们认为,心理胜任力应成为模型提供商、部署组织、研究人员和监管机构在关注面向人类 AI 系统的现实世界影响时的核心考量。
引用
@article{arxiv.2607.08288,
title = {From Legacy Documentation to OSCAL: An MCP-Based Agent Pipeline for Threat-Informed Continuous Compliance in Critical Infrastructure},
author = {Lea Roxanne Muth and Marian Margraf},
journal= {arXiv preprint arXiv:2607.08288},
year = {2026}
}
备注
Accepted for publication at the 2026 IEEE International Conference on Cyber Security and Resilience (IEEE CSR), Lisbon, Portugal, August 3-5, 2026. 8 pages, 1 figure