将AI模型评估锚定于人类衍生标准的方法
人工智能
2025-09-08 v1 人机交互
摘要
在快速发展的人工智能(AI)领域,传统基准测试在试图捕捉AI模型的细微能力时往往存在不足。我们聚焦于物理世界建模这一案例,提出了一种利用人类衍生评估标准来增强现有基准测试的新方法,旨在提升模型行为的可解释性与适用性。我们将研究锚定于 Perception Test 和 OpenEQA 基准测试,通过深度访谈和大规模调查,识别了对AI与人类推理均至关重要的关键认知技能,如优先级划分、记忆、辨识和情境化。我们的研究结果显示,参与者认为AI缺乏解释性和共情技能,但对AI的性能抱有很高期望。通过将研究发现的见解整合到基准测试设计中,我们提供了一个框架,用于开发更具人类对齐的进度定义与衡量手段。本研究强调了以用户为中心的评估在AI发展中的重要性,为旨在使AI能力与人类认知过程对齐的研究人员和从业者提供了可操作的指南。我们的方法既增强了当前的基准测试实践,也为未来AI模型评估的进步奠定了基础。
引用
@article{arxiv.2509.04676,
title = {An Approach to Grounding AI Model Evaluations in Human-derived Criteria},
author = {Sasha Mitts},
journal= {arXiv preprint arXiv:2509.04676},
year = {2025}
}
备注
4 figures, 6 pages, presented at CHI 2025 Workshop on Human-AI Interaction for Augmented Reasoning