通过大型多模态模型中的多语言提示提升文本到图像生成
计算与语言
2025-01-14 v1
摘要
之前的工作在为大型多模态模型 (LMM) 的文本到图像 (T2I) 生成进行数据增强时,主要关注丰富上下文学习 (ICL) 的输入空间,包括提供少量演示和优化图像描述以使其更详细且更具逻辑性。然而,随着对更复杂和灵活的图像描述需求的增长,增强 ICL 框架下输入文本的理解仍是一个关键且充机探索的领域。本文延续此研究路径,通过构建平行多语言提示来利用 LMM 的多语言能力。具体而言,我们将输入文本翻译成多种语言,并为模型提供原始文本及其翻译。实验在两个 LMM 上进行,涵盖 3 个基准测试,结果表明我们提出的方法 PMT2I 在整体、组合和细粒度评估中均实现了优异性能,尤其在人类偏好对齐方面表现突出。此外,凭借生成更多样化图像的优势,PMT2I 在集成重排序方法后显著超越基线提示。我们的代码和平行多语言数据可在 https://github.com/takagi97/PMT2I 查找。
引用
@article{arxiv.2501.07086,
title = {Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models},
author = {Yongyu Mu and Hengyu Li and Junxin Wang and Xiaoxuan Zhou and Chenglong Wang and Yingfeng Luo and Qiaozhi He and Tong Xiao and Guocheng Chen and Jingbo Zhu},
journal= {arXiv preprint arXiv:2501.07086},
year = {2025}
}
备注
Accepted to ICASSP 2025