基于点击率驱动的多模态大语言模型广告图像生成
机器学习
2025-02-13 v1 计算机视觉与模式识别
图形学
信息检索
摘要
在网页数据中,广告图像是捕获用户注意力和提高广告效果的关键因素。现有大多数方法主要聚焦于提升产品背景的审美质量,可能无法实现令人满意的线上表现。为此,我们探索使用多模态大语言模型(MLLMs)通过以点击率(CTR)为主要目标生成广告图像。首先,我们构建针对性的预训练任务,并利用大规模电商多模态数据集,使 MLLMs 具备初始的广告图像生成能力。为进一步提升生成图像的 CTR,我们提出一种新型奖励模型,通过强化学习(RL)微调预训练的 MLLMs,该模型能够联合利用多模态特征,准确反映用户点击偏好。同时,我们开发了一种以产品为中心的偏好优化策略,以确保微调后生成的背景内容与产品特征相吻合,增强广告图像的整体相关性和效果。 extensive experiments have demonstrated that our method achieves state-of-the-art performance in both online and offline metrics. Our code and pre-trained models are publicly available at: https://github.com/Chenguoz/CAIG.
引用
@article{arxiv.2502.06823,
title = {CTR-Driven Advertising Image Generation with Multimodal Large Language Models},
author = {Xingye Chen and Wei Feng and Zhenbang Du and Weizhen Wang and Yanyin Chen and Haohan Wang and Linkai Liu and Yaoyu Li and Jinyuan Zhao and Yu Li and Zheng Zhang and Jingjing Lv and Junjie Shen and Zhangang Lin and Jingping Shao and Yuanjie Shao and Xinge You and Changxin Gao and Nong Sang},
journal= {arXiv preprint arXiv:2502.06823},
year = {2025}
}
备注
Accepted to WWW 2025