基于 GAN 的多模态图像生成:整合文本、图像与风格
计算机视觉与模式识别
2025-01-07 v1
摘要
在计算机视觉领域, 多模态图像生成已成为研究热点, 尤其是整合文本、图像与风格的任务。本研究提出一种基于生成对抗网络 (GAN) 的多模态图像生成方法, 能有效地将文本描述、参考图像与风格信息综合, 生成满足多模态要求的图像。该方法涉及文本编码器、图像特征提取器与风格集成模块的设计, 确保生成图像在视觉内容与风格一致性方面具有高质量。我们还引入多个损失函数, 包括对抗损失、文本-图像一致性损失与风格匹配损失, 以优化生成过程。实验结果表明, 本方法在多个公开数据集上生成图像清晰度高、跨模态一致性佳, 显示出显著优于现有方法的性能。本研究的结论为多模态图像生成提供新思路, 并展现广泛的应用前景。
引用
@article{arxiv.2501.02167,
title = {Generating Multimodal Images with GAN: Integrating Text, Image, and Style},
author = {Chaoyi Tan and Wenqing Zhang and Zhen Qi and Kowei Shih and Xinshi Li and Ao Xiang},
journal= {arXiv preprint arXiv:2501.02167},
year = {2025}
}