中文

CUAAudit:面向自主计算机使用智能体的视觉语言模型元评估

人工智能 2026-03-13 v2 人机交互

摘要

计算机使用智能体(CUA)正成为人机交互的新范式,使其能够通过感知高层次自然语言指令,在桌面环境中自主执行任务。随着这些智能体变得越来越有能力并在多样化的桌面环境中部署,评估其在可扩展且可靠的方式下的行为变得至关重要。现有的评估管道依赖静态基准、基于规则的成功检查或人工检查,这些方法都脆弱、成本高昂且与实际使用场景不符。本文我们研究将视觉语言模型(VLM)作为评估CUA任务完成情况的自主审计员,从可观察的交互中对任务完成进行评估,并对五种VLM进行大规模的元评估,评估这些模型在给定自然语言指令和最终环境状态的情况下判断任务成功。我们的评估跨越三个广泛使用的CUA基准,覆盖macOS、Windows和Linux环境,并分析了审计员在三个互补维度上的行为:准确性、置信度估计的校准以及模型间的一致性。我们发现,尽管最先进的VLM在准确性和校准方面取得了强劲的表现,但所有审计员在更复杂或更异构的环境中都表现出显著的性能下降,甚至是高性能模型在判断方面也存在显著的不一致。这些结果揭示了当前基于模型的审计方法的根本局限,凸显了在实际环境中部署自主CUA时,需要明确地考虑评估器的可靠性、不确定性和方差的必要性。

关键词

引用

@article{arxiv.2603.10577,
  title  = {CUAAudit: Meta-Evaluation of Vision-Language Models as Auditors of Autonomous Computer-Use Agents},
  author = {Marta Sumyk and Oleksandr Kosovan},
  journal= {arXiv preprint arXiv:2603.10577},
  year   = {2026}
}

备注

This work has been accepted to appear at the HEAL @ CHI 2026 Worshop on Human-centered Evaluation and Auditing of Language Models