设计中的 AI 裁判:统计视角下的实现人类专家等效性
人工智能
2025-04-02 v1 机器学习
摘要
早期工程设计(如概念草图)的主观评估传统上依赖于人类专家。然而,专家评估耗时、昂贵且有时不一致。近期视觉语言模型(VLM)的进展为自动化设计评估提供了潜力,但关键在于确保这些AI“裁判”的表现与人类专家相当。然而,现有框架尚无用于评估专家等效性的工具。本文引入一个严格的统计框架,用于确定AI裁判的评分是否与人类专家一致。我们在案例研究中将此框架应用于评估四个基于VLM的裁判在关键设计指标(独特性、创造性、实用性和绘图质量)上的表现。这类AI裁判采用各种基于情境学习(ICL)技术,包括单模态与多模态提示以及推理时的方法。相同的统计框架用于评估三位训练过的初学者是否达到专家等效性。结果表明,表现最佳的AI裁判——采用文本与图像基于情境学习结合推理——在独特性和绘图质量方面实现专家水平一致性,并在所有指标上超越或匹配训练过的初学者。在独特性和创造性的6/6次实验中,以及绘图质量和实用性的5/6次实验中,其与专家的一致性达到或超过大多数训练过的初学者的一致性。这些发现表明,支持推理的VLM模型在设计评估中可实现人类专家等效性。这对教育和实践中的设计评估规模化具有意义,并为评估其他需要主观内容评估的AI裁判提供了通用统计框架。
引用
@article{arxiv.2504.00938,
title = {AI Judges in Design: Statistical Perspectives on Achieving Human Expert Equivalence With Vision-Language Models},
author = {Kristen M. Edwards and Farnaz Tehranchi and Scarlett R. Miller and Faez Ahmed},
journal= {arXiv preprint arXiv:2504.00938},
year = {2025}
}
备注
21 pages, 8 tables, 6 figures, 8 tables in the appendix