无真值条件下以实体为中心的 AI 系统的方差有界评估:理论与测量
机器学习
2025-11-05 v2 人工智能
机器学习
摘要
在缺乏真实标签的情况下,对 AI 系统进行可靠评估仍是一项根本性挑战,尤其对于生成自然语言输出的系统,如 AI 聊天和智能体系统。许多此类 AI 智能体和系统专注于以实体为中心的任务。在企业环境中,组织部署 AI 系统用于实体链接、数据集成和信息检索,但由于专有数据的限制,对照金标准进行验证往往不可行。学术部署在评估针对具有模糊标准的专门数据集的 AI 系统时也面临类似挑战。植根于监督学习范式的传统评估框架,在无法定义单一正确答案的场景中会失效。我们引入了 VB-Score,一个面向以实体为中心的 AI 系统的方差有界评估框架,该框架无需真实标签,通过联合测量有效性和鲁棒性来运作。给定系统输入,VB-Score 通过约束松弛和蒙特卡洛采样枚举出合理的解释,并赋予反映其可能性的概率。然后,它根据系统输出在所有解释上的期望成功率进行评估,并用方差进行惩罚以评估系统的鲁棒性。我们提供了形式化的理论分析,确立了包括范围、单调性和稳定性在内的关键属性,以及蒙特卡洛估计的集中不等式。通过对处理歧义输入的 AI 系统进行案例研究,我们证明 VB-Score 揭示了传统评估框架所隐藏的鲁棒性差异,为在标签稀缺领域评估 AI 系统可靠性提供了一个原则性的测量框架。
引用
@article{arxiv.2509.22751,
title = {Variance-Bounded Evaluation of Entity-Centric AI Systems Without Ground Truth: Theory and Measurement},
author = {Kaihua Ding},
journal= {arXiv preprint arXiv:2509.22751},
year = {2025}
}