GPT-4o 能否像人类专家一样评估可用性?对比研究:赫希定评中问题识别
人机交互
2026-05-12 v1
摘要
赫希定评估是人机交互(HCI)中一种广泛使用的方法,用于检查界面并基于赫希定则识别问题。最近,大型语言模型(LLM)如 GPT-4o 已被应用于 HCI 中,以协助创建人物画像、构思过程以及半结构化访谈分析。然而,鉴于需要理解赫希定则以及评估它们所需的高度抽象,LLM 在进行赫希定评估方面可能存在困难。尽管如此,目前的研究尚未对比调查 GPT-4o 在 Web 系统中的赫希定评性能。本研究旨在比较 GPT-4o 与人类专家进行赫希定评的结果。为此,我们选取了一组网页系统的截图,并要求 GPT-4o 根据文献依据的提示,从 Nielsen 赫希定则进行赫希定评。我们的结果表明,尽管 GPT-4o 发现了 27 个新的问题,但仅有 21.2% 的问题被人类专家识别。我们还发现,GPT-4o 在与美学和简约设计以及系统与现实世界匹配相关的赫希定则方面表现更好,而在灵活性、控制性和用户效率相关的赫希定则方面则难以识别问题。此外,我们注意到 GPT-4o 由于幻觉和试图预测问题而生成了多个误报。最后,我们提出了五点关于在赫希定评中慎用 GPT-4o 的建议。
引用
@article{arxiv.2506.16345,
title = {Can GPT-4o Evaluate Usability Like Human Experts? A Comparative Study on Issue Identification in Heuristic Evaluation},
author = {Guilherme Guerino and Luiz Rodrigues and Bruna Capeleti and Rafael Ferreira Mello and André Freire and Luciana Zaina},
journal= {arXiv preprint arXiv:2506.16345},
year = {2026}
}
备注
Paper accepted at the 20th IFIP TC13 International Conference on Human-Computer Interaction (INTERACT) 2025