从准确性到准备就绪:人类- AI 决策的指标与基准
人机交互
2026-03-20 v1 人工智能
机器学习
摘要
人工智能(AI)系统被部署为人类决策中的合作者。然而,评估实践主要聚焦于模型准确性,而非人类- AI 团队是否准备好安全且有效地合作。实证证据表明,许多失败源于依赖误配,包括在 AI 错误时过度依赖,在 AI 有帮助时不足依赖。本文提出了以团队准备就绪为中心的人类- AI 决策评估测量框架。我们引入四部分评估指标体系,涵盖结果、依赖行为、安全信号和随时间学习,並将这些指标与人类- AI 入职和合作的 Understand-Control-Improve(U-C-I)生命周期联系起来。通过通过交互痕迹来操作化评估,而非模型属性或自我报告的信任,本框架 enables for deployment-relevant assessment of calibration、error recovery and governance。我们旨在支持更可比的基准和可累积的研究,推动更安全、更具问责性的人类- AI 合作。
引用
@article{arxiv.2603.18895,
title = {From Accuracy to Readiness: Metrics and Benchmarks for Human-AI Decision-Making},
author = {Min Hun Lee},
journal= {arXiv preprint arXiv:2603.18895},
year = {2026}
}
备注
ACM CHI 2026 Poster