中文

生成式AI能否取代检查员?探究生成式AI在可用性检查中的潜在作用

软件工程 2025-10-21 v1 人机交互

摘要

可用性检查是一种已确立的技术,用于识别软件界面中的交互问题,从而促进产品质量的提高。然而,这一过程成本高昂,需要时间和来自检查员的专业知识。随着人工智能(AI)的进步,新的机会出现了通过能够解释界面并更高效地执行检查的生成模型来支持这一任务。本研究 examines 生成式AI在识别可用性问题方面的性能,将其与经验丰富的人类检查员进行比较。评估了一个软件原型,由四位专家和两个AI模型(GPT-4o和Gemini 2.5 Flash)进行测试,使用诸如精确率、召回率和F1分数等指标。虽然检查员实现了最高的精确率和整体覆盖率,但AI demonstrated出色的个人表现,发现了许多新奇缺陷,但误报率较高且报告重复。AI与人类检查员的组合产生了最佳结果,揭示了它们之间的互补性。这些发现表明,AI在当前阶段无法取代人类检查员,但可以作为提高效率和扩展缺陷覆盖范围的有价值工具。结果提供了基于量化分析的证据,以信息化讨论AI在可用性检查中的角色,指向其在软件质量评估情境中实现互补性的可行路径。

关键词

引用

@article{arxiv.2510.17056,
  title  = {Will AI also replace inspectors? Investigating the potential of generative AIs in usability inspection},
  author = {Luis F. G. Campos and Leonardo C. Marques and Walter T. Nakamura},
  journal= {arXiv preprint arXiv:2510.17056},
  year   = {2025}
}

备注

Accepted and to be published in SBQS25 - Brazilian Symposium on Software Quality 2025