中文

面向电商创意优化的多示例奖励学习生成式建模

机器学习 2025-08-14 v1

摘要

在电商广告中,选择最具吸引力的创意元素组合——如标题、图片和亮点——对于吸引用户注意力和驱动转化至关重要。然而,现有方法通常单独评估创意组件,无法应对可能组合的指数级搜索空间。为应对这一挑战,我们提出了一种名为GenCO的新颖框架,该框架将生成式建模与多示例奖励学习相结合。我们统一的两阶段架构首先采用生成模型高效地产生多样化的创意组合。此生成过程通过强化学习进行优化,使模型能够有效探索并优化其选择。接着,为克服用户反馈稀疏的挑战,一个多示例学习模型将组合级别的奖励(如点击)归因于各个创意元素。这使得奖励模型能够提供更准确的反馈信号,进而引导生成模型创造出更有效的组合。该方法已部署于一个领先的电商平台,显著提升了广告收入,证明了其实用价值。此外,我们正在发布一个大规模工业数据集,以促进这一重要领域的进一步研究。

关键词

引用

@article{arxiv.2508.09730,
  title  = {Generative Modeling with Multi-Instance Reward Learning for E-commerce Creative Optimization},
  author = {Qiaolei Gu and Yu Li and DingYi Zeng and Lu Wang and Ming Pang and Changping Peng and Zhangang Lin and Ching Law and Jingping Shao},
  journal= {arXiv preprint arXiv:2508.09730},
  year   = {2025}
}

备注

9 pages, 3 figures, conference paper