中文

UIPress:将光学令牌压缩引入UI到代码生成

计算与语言 2026-04-13 v1

摘要

UI到代码生成需要视觉语言模型(VLM)从单个屏幕截图生成数千个结构化HTML/CSS标记,使得视觉令牌效率至关重要。现有压缩方法要么在推理时使用任务无关的启发式方法选择令牌,要么在未实际缩短序列长度的情况下消零低注意力特征—— neither 真正减少预热延迟,也不适应UI屏幕截图中非均匀信息密度。与此同时,光学(编码器侧学习)压缩在文档OCR中显示出强大的性能,但目前尚无工作将此范式应用于UI到代码生成。我们提出UIPress,一个轻量级的学习压缩模块,插入在冻结的ViT编码器和LLM解码器之间。UIPress结合深度可分离卷积、元素引导的空间重加权和Transformer细化,将约6700个视觉令牌压缩到固定预算的256个令牌。配合解码器上的低秩适应(LoRA),整个系统仅添加约2170万可训练参数(占8B基础模型的0.26%)。在Design2Code数据集上,与四个基线相比,UIPress在256个令牌处实现CLIP得分0.8127,超越未压缩基线提升7.5%,超过最强的推理时方法提升4.6%,同时实现9.1倍的首字延迟加速。据我们所知,UIPress是面向UI到代码任务的首个编码器侧学习压缩方法。

关键词

引用

@article{arxiv.2604.09442,
  title  = {UIPress: Bringing Optical Token Compression to UI-to-Code Generation},
  author = {Dasen Dai and Shuoqi Li and Ronghao Chen and Huacan Wang and Biao Wu and Qizhen Lan},
  journal= {arXiv preprint arXiv:2604.09442},
  year   = {2026}
}

备注

10 pages, 3 figures