中文

SusBench:用于评估计算机使用代理对暗模式脆弱性的在线基准

人机交互 2026-02-24 v2

摘要

随着基于大语言模型的计算机使用代理(CUA)开始自主地与真实世界的界面进行交互,理解它们对操纵性界面设计的脆弱性变得越来越关键。我们引入了SusBench,这是一个用于评估CUA是否容易受到UI暗模式(旨在操纵或欺骗用户执行非本意行动的界面设计)影响的在线基准。我们从现有分类中提取九种常见的暗模式类型,通过代码注入在真实消费者网站上构建可信的暗模式,并设计了55个网站上的313个评估任务。我们对29名参与者的研究显示,人类参与者认为我们的暗模式注入高度逼真,绝大多数参与者没有注意到这些被研究团队注入的事实。我们对基准进行了五种最先进的CUA的评估。我们发现,人类参与者和代理人对Preselection、Trick Wording和Hidden Information等暗模式尤其脆弱,而对其他明显的暗模式则较为有韧性。我们的发现为开发更可信的CUA、将其用作评估欺骗性设计的人类代理,以及监管日益由自主代理人导航的在线环境提供了指导。

关键词

引用

@article{arxiv.2510.11035,
  title  = {SusBench: An Online Benchmark for Evaluating Dark Pattern Susceptibility of Computer-Use Agents},
  author = {Longjie Guo and Chenjie Yuan and Mingyuan Zhong and Robert Wolfe and Ruican Zhong and Yue Xu and Bingbing Wen and Hua Shen and Lucy Lu Wang and Alexis Hiniker},
  journal= {arXiv preprint arXiv:2510.11035},
  year   = {2026}
}

备注

Accepted as a full paper to IUI 2026