中文

行为优化图像生成

计算机视觉与模式识别 2023-11-21 v1 计算与语言

摘要

过去几年中,图像生成取得了巨大成功,其美学水平已跨越接受阈值,可直接应用于个人与商业场景。然而,图像(尤其在营销与广告应用中)常作为达成某种目的的手段而被创作,而非仅关乎美学。其目标可能是提升销量、获取更多点击、点赞或图像销售(对图库业务而言)。因此,除具备美学品质外,生成图像还需在这些关键绩效指标(KPIs)上表现良好。本文首次尝试回答“如何在图像生成过程中融入终端目标的知识,以创造出不仅更好看而且‘表现更好’的图像?”这一问题。我们提出 BoigLLM,一种同时理解图像内容与用户行为的大语言模型(LLM)。BoigLLM 知晓为获得特定所需 KPI,图像应呈现何种样貌。我们表明,在此任务上 BoigLLM 优于 GPT-3.5 与 GPT-4 等参数量大 13 倍的模型,说明尽管这些最先进(SOTA)模型能理解图像,却缺乏关于这些图像在真实世界中表现如何的信息。为生成行为条件图像的实际像素,我们训练了一个基于扩散的模型(BoigSD)以对齐所提出的 BoigLLM 定义的奖励。我们在两个覆盖不同行为的数据集上展示了整体流程的性能:以转发行为次数为 KPI 的图库数据集,以及以总点赞数为 KPI 的推文数据集,记为 BoigBench。为推动效用驱动图像生成与理解方向的研究,我们发布了 BoigBench,一个包含 1.68 亿条企业推文及其媒体、品牌账号名、发布时间与总点赞数的基准数据集。

关键词

引用

@article{arxiv.2311.10995,
  title  = {Behavior Optimized Image Generation},
  author = {Varun Khurana and Yaman K Singla and Jayakumar Subramanian and Rajiv Ratn Shah and Changyou Chen and Zhiqiang Xu and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:2311.10995},
  year   = {2023}
}