中文

利用强化学习提升Facebook上生成式广告文本

机器学习 2025-12-16 v2

摘要

生成式人工智能(AI),特别是大语言模型(LLM),正准备驱动变革性的经济变革。LLM 预训练于大规模文本数据以学习通用语言模式,但后续的微调阶段对于将其针对特定实际任务对齐至关重要。强化学习(RL)是领先的后训练技术,但其经济影响仍大体未被量化。我们通过 Facebook 上首次部署用于生成式广告的 RL 训练 LLM 来审视此问题。集成到 Meta 的文本生成功能中,我们的模型“AdLlama”为帮助广告主创建人工书写广告文本的新变体提供 AI 工具。为训练此模型,我们引入基于绩效反馈的强化学习(RLPF),即使用历史广告绩效数据作为奖励信号。在 Facebook 上规模为 10 周的 A/B 测试中,覆盖近 35,000 名广告主和 640,000 条广告变体,我们发现 AdLlama 比在精选广告上进行监督模仿训练的模型提高点击率 6.7%(p=0.0296),这代表了 Facebook 上广告主投资回报率的显著提升。我们也发现使用 AdLlama 的广告主生成了更多广告变体,表明用户对模型输出更满意。据我们所知,这是迄今为止规模最大的生成式 AI 在生态学有效情境下的研究,为量化 RL 后训练的实际影响提供了重要数据。此外,结果表明 RLPF 是一种有前景且可推广的后训练方法,能够在高度强大的语言模型与实际结果之间搭建桥梁。

关键词

引用

@article{arxiv.2507.21983,
  title  = {Improving Generative Ad Text on Facebook using Reinforcement Learning},
  author = {Daniel R. Jiang and Alex Nikulkov and Yu-Chia Chen and Yang Bai and Zheqing Zhu},
  journal= {arXiv preprint arXiv:2507.21983},
  year   = {2025}
}

备注

D.J. and A.N. contributed equally, 41 pages, 6 figures