基于注意力机制的无需微调的 GUI 基准化
计算机视觉与模式识别
2024-12-17 v1
摘要
多模态大语言模型(MLLM)的最新进展在其能够自主与图形用户界面(GUI)交互和解释方面引起了广泛关注。这些系统的一个主要挑战是基准化——准确识别基于GUI图像和相应文本查询的关键GUI组件,如文本或图标。传统上,这一任务依赖于使用专门训练数据微调MLLM以直接预测组件位置。然而,本文提出了一种 novel Tuning-free Attention-driven Grounding(TAG)方法,利用预训练MLLM中固有的注意力模式来完成此任务,而无需额外微调。我们的方法涉及识别和聚合来自精心构建查询提示中特定标记的注意力图。应用于 MiniCPM-Llama3-V 2.5,这种无调优方法的性能相当于基于调优的方法,在文本局部化方面表现突出。此外,我们展示了基于注意力图的基准化技术显著优于 MiniCPM-Llama3-V 2.5 的直接局部化预测,凸显了利用预训练MLLM注意力图的潜力,为该领域的未来创新之路。
引用
@article{arxiv.2412.10840,
title = {Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning},
author = {Hai-Ming Xu and Qi Chen and Lei Wang and Lingqiao Liu},
journal= {arXiv preprint arXiv:2412.10840},
year = {2024}
}
备注
Accepted to AAAI 2025