中文

面向汽车 UI 的视觉-语言模型驱动的视觉 grounding 与分析

计算机视觉与模式识别 2025-08-06 v3 人工智能

摘要

现代汽车中控系统需要智能且具有适应性的解决方案来管理频繁的用户界面(UI)更新和多样化的设计变体。本 work 引入了一种视觉-语言框架来促进对汽车 UI 的理解和交互,实现跨不同 UI 设计的无缝适应。为支持该领域的研究,还发布了一个由 998 张图片、4208 项标注组成的开源数据集 AutomotiveUI-Bench-4K。此外,还介绍了一个用于生成训练数据的数据管道。对基于 Molmo-7B 的模型进行低秩适应(LoRa)微调,集成推理、视觉 grounding 和评估功能。微调后的可评估型大型动作模型(ELAM)在 AutomotiveUI-Bench-4K 上取得优异成绩(模型和数据集已在 Hugging Face 上提供)。该方法在跨域泛化方面表现突出,在 ScreenSpot 上实现 +5.6% 的提升。尽管主要在汽车领域训练,ELAM 在 ScreenSpot 上的平均准确率达 80.8%,与针对桌面、移动和 web 的专用模型相当甚至更好。该研究探讨了数据收集和后续微调如何导致汽车 UI 理解和交互的 AI 驱动进展。所采用的方法成本效益高,微调后的模型可部署在消费级 GPU 上。

关键词

引用

@article{arxiv.2505.05895,
  title  = {Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI},
  author = {Benjamin Raphael Ernhofer and Daniil Prokhorov and Jannica Langner and Dominik Bollmann},
  journal= {arXiv preprint arXiv:2505.05895},
  year   = {2025}
}