中文

UI-JEPA:面向用户意图主动感知的Onscreen用户活动

计算与语言 2024-10-03 v3 人工智能 人机交互 机器学习

摘要

从用户界面(UI)动作序列中生成用户意图是全面理解UI的核心挑战。近期多模态大语言模型(MLLM)的快速发展在这一领域取得了显著进展,但其对大量模型参数、计算资源和高延迟的依赖,使得其在需要轻量级、本地部署且延迟低或隐私性高的场景下难以实用。此外,缺乏高质量数据集也阻碍了此类轻量级模型的开发。为此,我们提出了UI-JEPA,这是一个新型框架,采用掩码策略通过自监督学习从无标签数据中学习抽象的UI嵌入表示,并结合经过微调的用户意图预测的大语言模型(LLM)解码器。我们还引入了两个新的UI grounding多模态数据集,"野外意图"(Intent in the Wild, IIW)和"驯服意图"(Intent in the Tame, IIT),分别为少样本和零样本UI理解任务设计。IIW包含1.7千个视频,覆盖219个意图类别;IIT包含914个视频,覆盖10个类别。我们为这些数据集建立了首个基线,表明采用JEPA风格目标学习到的表示,结合LLM解码器,能够实现与最先进大型MLLM相当的用户意图预测性能,但显著降低了标注和部署资源。根据意图相似度评分,UI-JEPA在两个数据集上的平均表现分别比GPT-4 Turbo和Claude 3.5 Sonnet高出10.0%和7.2%。值得注意的是,在IIW数据集上,UI-JEPA仅需50.5倍的计算资源,延迟提升6.6倍即可达到相似性能。这一结果凸显了UI-JEPA的有效性,突显了其在轻量级高性能UI理解方面的潜力。

关键词

引用

@article{arxiv.2409.04081,
  title  = {UI-JEPA: Towards Active Perception of User Intent through Onscreen User Activity},
  author = {Yicheng Fu and Raviteja Anantha and Prabal Vashisht and Jianpeng Cheng and Etai Littwin},
  journal= {arXiv preprint arXiv:2409.04081},
  year   = {2024}
}