MLLM作为UI评判器:为预测用户界面感知而构建的多模态LLM基准
人机交互
2025-10-13 v1 人工智能
摘要
在理想的设计流程中,用户界面(UI)设计与用户研究紧密相连,以验证决策,但在早期探索阶段往往受资源限制。最近的多模态大语言模型(MLLM)进展为充当早期评估器、帮助设计师在正式测试前缩小选项范围提供了广阔的机遇。不同于强调在狭窄领域如电子商务中以点击或转化等指标衡量用户行为的先前工作,我们关注跨各种界面的主观用户评估。我们调查MLLM是否能够在评估单个UI和比较UI时模拟人类偏好。我们使用来自众包平台的数据,对GPT-4o、Claude和Llama进行基准测试,涵盖30个界面,并检验其在多个UI因素上的人类判断一致性。我们的结果表明,MLLM在某些维度上近似于人类偏好,但在其他维度上存在偏差,这凸显了其在补充早期用户体验研究方面的潜力与局限性。
引用
@article{arxiv.2510.08783,
title = {MLLM as a UI Judge: Benchmarking Multimodal LLMs for Predicting Human Perception of User Interfaces},
author = {Reuben A. Luera and Ryan Rossi and Franck Dernoncourt and Samyadeep Basu and Sungchul Kim and Subhojyoti Mukherjee and Puneet Mathur and Ruiyi Zhang and Jihyung Kil and Nedim Lipka and Seunghyun Yoon and Jiuxiang Gu and Zichao Wang and Cindy Xiong Bearfield and Branislav Kveton},
journal= {arXiv preprint arXiv:2510.08783},
year = {2025}
}