中文

UI-UG:用于 UI 理解与生成的统一多模态大语言模型

计算机视觉与模式识别 2025-10-01 v2 人工智能 人机交互

摘要

尽管多模态大语言模型(MLLM)已在多个领域得到广泛应用,但它们在领域特定任务上仍面临挑战,例如用户界面(UI)理解准确率和 UI 生成质量。本文提出 UI-UG(一个用于 UI 理解与生成的统一 MLLM),整合了两项能力。对于理解任务,我们采用监督微调(SFT)结合组相对策略优化(GRPO)来增强对现代复杂 UI 数据的细粒度理解。对于生成任务,我们进一步使用直接偏好优化(DPO)使模型生成人类偏好的 UI。此外,我们提出了一种工业上有效的工作流程,包括设计面向 LLM 的领域特定语言(DSL)、训练策略、渲染流程和评估指标。实验结果表明,我们的模型在理解任务上达到了最先进的(SOTA)性能,超越了更大规模的通用 MLLM 和同等规模的 UI 专用模型。在 UI 生成性能方面,我们的模型以 fraction 的计算成本达到了与这些更大 MLLM 相当的水平。我们还证明,整合理解与生成任务可以同时提升两项任务的准确率和质量。代码与模型:https://github.com/neovateai/UI-UG

关键词

引用

@article{arxiv.2509.24361,
  title  = {UI-UG: A Unified MLLM for UI Understanding and Generation},
  author = {Hao Yang and Weijie Qiu and Ru Zhang and Zhou Fang and Ruichao Mao and Xiaoyu Lin and Maji Huang and Zhaosong Huang and Teng Guo and Shuoyang Liu and Hai Rao},
  journal= {arXiv preprint arXiv:2509.24361},
  year   = {2025}
}