中文

从提示到产品:智能体式应用生成系统的人类中心基准

人机交互 2026-02-16 v2 人工智能 软件工程

摘要

能够从自然语言提示生成完整全栈 Web 应用的智能体 AI 系统('prompt-to-app')代表了软件开发的重大变革。然而,在现实中、以人类中心为导向的评估标准下,这些系统的表现仍不为人所知,因为视觉 polish、功能正确性和用户信任往往相互脱节。本文引入面向人类的基准框架,用于评估 prompt-to-app 系统,并对三大主流平台(Replit、Bolt、Firebase Studio)进行大规模比较研究。我们构建包含 96 个涵盖常见 Web 应用任务的提示集,生成 288 个独特应用作品。通过 205 名参与者和 1,071 项经筛选的成对比较,评估这些系统在基于任务的易用性、视觉吸引力、感知完整性和用户信任方面的表现。结果显示,这些系统并非互相替代:Firebase Studio 在所有人类评估维度上均取得最佳表现,实现了易用性、信任、视觉吸引力和视觉恰当性的最高胜率;Bolt 在视觉吸引力方面表现有竞争力,但在可用性和信任方面落后于 Firebase;Replit 在大多数指标上均落后于两者。我们的发现凸显了视觉 polish 与功能可靠性之间持续的鸿沟,并证明了交互式、基于任务的评估的必要性。我们公开了基准框架、提示集以及生成的作品,以支持可重复评估和未来研究。

关键词

引用

@article{arxiv.2512.18080,
  title  = {From Prompt to Product: A Human-Centered Benchmark of Agentic App Generation Systems},
  author = {Marcos Ortiz and Justin Hill and Collin Overbay and Ingrida Semenec and Frederic Sauve-Hoover and Jim Schwoebel and Joel Shor},
  journal= {arXiv preprint arXiv:2512.18080},
  year   = {2026}
}