LightGen:通过知识蒸馏和直接偏好优化实现高效图像生成
计算机视觉与模式识别
2025-03-12 v1
摘要
近期文本到图像生成的进展主要依赖于大规模数据集和参数密集的架构。这些要求严重限制了缺乏大量计算资源的研究人员和从业者的可及性。在本文中,我们提出了LightGen,一种高效的图像生成模型训练范式,它利用知识蒸馏(KD)和直接偏好优化(DPO)。借鉴多模态大语言模型(MLLMs)中广泛采用的数据KD技术的成功经验,LightGen将最先进的文本到图像模型的知识蒸馏到一个仅有0.7B参数的紧凑掩码自回归(MAR)架构中。仅使用来自多样化描述的2M高质量图像组成的紧凑合成数据集,我们证明了数据多样性在决定模型性能方面远胜于数据量。这一策略大幅降低了计算需求,将预训练时间从潜在的数千GPU天减少到仅88 GPU天。此外,为了解决合成数据的固有缺陷,特别是高频细节差和空间不准确的问题,我们集成了DPO技术来提升图像保真度和位置精度。全面的实验证实LightGen在保持与最先进模型相当的图像生成质量的同时,显著降低了计算资源需求并扩大了资源受限环境下的可及性。代码可在https://github.com/XianfengWu01/LightGen获取。
引用
@article{arxiv.2503.08619,
title = {LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference Optimization},
author = {Xianfeng Wu and Yajing Bai and Haoze Zheng and Harold Haodong Chen and Yexin Liu and Zihao Wang and Xuran Ma and Wen-Jie Shu and Xianzu Wu and Harry Yang and Ser-Nam Lim},
journal= {arXiv preprint arXiv:2503.08619},
year = {2025}
}
备注
Code: https://github.com/XianfengWu01/LightGen