VisionTasker:基于视觉 UI 理解与 LLM 任务规划的移动任务自动化
人机交互
2024-10-15 v2
摘要
移动任务自动化是一个新兴领域,它利用 AI 简化和优化移动设备上日常任务的执行,从而提高效率和生产力。传统方法(如 Programming By Demonstration, PBD)由于依赖预定义任务且易受应用更新的影响而存在局限性。最近的进展利用视图层级来收集 UI 信息,并采用大型语言模型 (LLM) 来增强任务自动化。然而,视图层级存在可访问性问题,并面临对象描述缺失或结构错位等潜在问题。本文介绍了 VisionTasker,这是一个结合了基于视觉的 UI 理解和 LLM 任务规划的两阶段框架,用于以逐步方式进行移动任务自动化。VisionTasker 首先使用基于视觉的 UI 理解方法将 UI 截图转换为自然语言解释,从而无需视图层级。其次,它采用逐步任务规划方法,每次向 LLM 呈现一个界面。然后 LLM 识别界面内的相关元素并确定下一步操作,从而提高了准确性和实用性。大量实验表明,VisionTasker 优于以往的方法,在四个数据集上提供了有效的 UI 表示。此外,在 Android 智能手机上自动化执行 147 项真实世界任务时,VisionTasker 在人类表现出不熟悉的任务中展现出优于人类的优势,并且在与 PBD 机制集成时表现出显著改进。VisionTasker 是开源的,可在 https://github.com/AkimotoAyako/VisionTasker 获取。
引用
@article{arxiv.2312.11190,
title = {VisionTasker: Mobile Task Automation Using Vision Based UI Understanding and LLM Task Planning},
author = {Yunpeng Song and Yiheng Bian and Yongtao Tang and Guiyu Ma and Zhongmin Cai},
journal= {arXiv preprint arXiv:2312.11190},
year = {2024}
}