中文

AFRAgent:一种基于自适应特征重 normalization 的高分辨率感知 GUI 智能体

计算机视觉与模式识别 2025-12-12 v2

摘要

移动用户界面 (UI) 自动化正因其在行业中的广泛应用而日益增长需求。随着视觉语言模型 (VLM) 的出现,GUI 自动化从为人类生成文本指令的阶段,发展到能够自主执行任务,从而优化自动化工作流程。最近的研究方法利用 VLM 处理该问题,主要基于三个方面:1) 直接处理屏幕内容;2) 独立于设备特定 API,利用人类动作(如点击、输入);3) 应用现实情境知识进行任务理解。然而,这些模型常常在准确识别小部件和确定动作方面受限于视觉编码器特征中的空间信息。此外,表现最好的模型往往规模庞大,需要大量训练且推理延迟高。在本文中,我们引入 AFRAgent,这是一个以 instruct-BLIP 为基础的多模态架构,在实现优异 GUI 自动化性能的同时,体积小于其最近竞争者的四分之一。为了增强大语言模型 (LLM) 管道中的图像嵌入,我们提出了一种基于自适应特征重 normalization 的技术(基于 token 级别仿射变换),有效丰富低分辨率图像嵌入并融合高分辨率细节。我们在 Meta-GUI 和 AITW 基准测试上评估了 AFRAgent,确立了智能手机自动化的新型 SOTA 基线。

关键词

引用

@article{arxiv.2512.00846,
  title  = {AFRAgent : An Adaptive Feature Renormalization Based High Resolution Aware GUI agent},
  author = {Neeraj Anand and Rishabh Jain and Sohan Patnaik and Balaji Krishnamurthy and Mausoom Sarkar},
  journal= {arXiv preprint arXiv:2512.00846},
  year   = {2025}
}

备注

Accepted at WACV 2026 Conference