中文

TinyClick:面向GUI自动化的单轮智能体

人机交互 2025-05-22 v3 人工智能

摘要

我们提出了一个用于用户界面(UI)交互任务的智能体,使用Vision-Language Model Florence-2-Base。该智能体的主要任务是识别用户命令对应UI元素的屏幕坐标。它在Screenspot和OmniAct标注数据上表现出色,同时保持仅0.27B参数的小规模和极低的延迟。此外,训练所需的GPU时间仅为56小时(约40美元)。来自视觉特定的多任务训练和基于MLLM的数据增强是本次改进的关键来源。我们希望通过降低对昂贵计算资源和手动标注数据的需求,将更易于实现和可持续地推动UI智能体的研究。

关键词

引用

@article{arxiv.2410.11871,
  title  = {TinyClick: Single-Turn Agent for Empowering GUI Automation},
  author = {Pawel Pawlowski and Krystian Zawistowski and Wojciech Lapacz and Adam Wiacek and Marcin Skorupa and Sebastien Postansque and Jakub Hoscilowicz},
  journal= {arXiv preprint arXiv:2410.11871},
  year   = {2025}
}

备注

Accepted to Interspeech 2025