中文

Lens:重新思考基础文本到图像模型的训练效率

计算机视觉与模式识别 2026-05-22 v1

摘要

我们引入 Lens,一个 38 亿参数的 T2I 模型,在各种基准测试中实现与甚至超过 60 亿参数的 SOTA 模型的表现,同时所需的训练计算显著更低。例如,Lens 仅需相当于 Z-Image 的 19.3% 的训练计算。Lens 的训练效率源于其紧凑模型规模之外的两个关键策略。首先,通过 (i) 在 Lens-800M 上进行训练,这是由 GPT-4.1 生成的 8000 万张密集标注图像-文本对数据集,其标注平均约为 109 词,提供比常规短标注更丰富的语义监督;以及 (ii) 从分辨率和宽高比多样化的图像中构建每个 batch,从而扩大每个优化步骤的有效视觉覆盖范围。其次,通过谨慎的架构选择提高收敛速度,包括采用语义 VAE 提供更好的潜在表示,并采用强大的语言编码器加速优化同时实现从英文唯一训练数据到多语言泛化的扩展。在预训练后,我们应用基于分类学驱动的提示(Lens-RL-8K)和结构化奖励评估表来抑制 artifact 并提升视觉质量,引入一个 reasoner 模块以训练-free 方式搜索系统提示以更好地对齐用户请求,以及 distillation 基于加速的 4 步推理。通过高效训练和系统化优化,Lens 能从 1:2 到 2:1 的任意宽高比泛化,并支持分辨率最高达 1440^2,以及几种常用语言的提示。得益于其紧凑尺寸,Lens 在单张 NVIDIA H100 GPU 上生成 1024^2 图像仅需 3.15 秒,而其蒸馏版 turbo 版本实现 4 步生成仅需 0.84 秒。

关键词

引用

@article{arxiv.2605.21573,
  title  = {Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models},
  author = {Dong Chen and Fangyun Wei and Ziyu Wan and Dongdong Chen and Jiawei Zhang and Jinjing Zhao and Sirui Zhang and Yang Yue and Zhiyang Liang and Baining Guo and Chong Luo and Jianmin Bao and Ji Li and Lei Shi and Qinhong Yang and Xiuyu Wu and Xuelu Feng and Yan Lu and Yanchen Dong and Yitong Wang and Yunuo Chen},
  journal= {arXiv preprint arXiv:2605.21573},
  year   = {2026}
}

备注

Project Page: https://github.com/microsoft/Lens