"我们完成了吗?":面向计算机使用智能体的基于视觉的任务完成判定器
人工智能
2025-11-26 v1 人机交互
摘要
计算机使用智能体(CUA)旨在自主操作数字接口,但往往无法可靠地确定给定任务是否已完成。我们提出一个使用视觉语言模型从屏幕截图和任务描述直接评估任务完成情况的自主评估和反馈框架。该数据集涵盖42个内置macOS应用程序和1260个人工标注的任务,涵盖广泛的场景。我们的框架在任务成功检测方面达到最高73%的准确率,在 evaluator反馈应用后,整体任务成功率平均提高了27%。这些结果表明,基于视觉的评估可作为有效的反馈机制,提高了自主计算机使用智能体的可靠性和自我纠正能力。
引用
@article{arxiv.2511.20067,
title = {"Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents},
author = {Marta Sumyk and Oleksandr Kosovan},
journal= {arXiv preprint arXiv:2511.20067},
year = {2025}
}
备注
This work has been accepted to appear at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)