MuLan:面向数百种语言的低成本多语言扩散模型适配
计算与语言
2025-06-06 v2 人工智能
摘要
本文探讨了一种高性价比的多语言图像生成框架。我们发现,与针对高质量带多语言标注图像进行微调的模型不同,利用在广泛可获得的噪声互联网图片-文本对上预训练的文本编码器,可显著提升跨多语言文本到图像(T2I)生成的数据效率。在此基础上,我们引入 MuLan,多语言适配器,一种参数不足 2000 万的轻量级语言适配器,联合在冻结的文本编码器和图像扩散模型上进行训练。与以往的多语言 T2I 模型相比,该框架提供:(1) 成本效益。使用 readily 可获得的英语数据和即插即用的多语言文本编码器,最小化训练成本;(2) 高性能。在超过 110 种语言上实现与英语相当的生成能力,CLIP 相似度分数几乎与英语持平(英语为 39.57,其他语言为 39.61);(3) 广泛适用性。无缝集成至兼容的社区工具如 LoRA、LCM、ControlNet 和 IP-Adapter,拓展了其潜在应用场景。
引用
@article{arxiv.2412.01271,
title = {MuLan: Adapting Multilingual Diffusion Models for Hundreds of Languages with Negligible Cost},
author = {Sen Xing and Muyan Zhong and Zeqiang Lai and Liangchen Li and Jiawen Liu and Yaohui Wang and Jifeng Dai and Wenhai Wang},
journal= {arXiv preprint arXiv:2412.01271},
year = {2025}
}