Pinterest Canvas:Pinterest 的大规模图像生成
计算机视觉与模式识别
2026-03-09 v1
摘要
虽然近期的图像生成模型在处理多种图像生成任务方面表现突出,但这种灵活性使得它们难以通过提示词或简单推理调整进行控制,因而不适用于对产品要求严格的场景。本文介绍 Pinterest Canvas——我们为支持 Pinterest 上图像编辑和增强用例构建的大规模图像生成系统。Canvas 首先在多模态多样化数据集上进行训练,构建具备广泛图像编辑能力的基础扩散模型。然而,我们并不依赖单一通用模型来处理所有下游任务,而是对该基础模型的不同变体进行快速微调,以适配特定任务的数据集,从而为每个场景生成专用模型。我们描述了 Canvas 的关键组件,并总结了数据集 curated、训练和推理的最佳实践。我们通过背景增强和宽高比扩展等案例研究展示了任务专用变体,阐述了如何满足其具体的产品需求。线上 A/B 实验表明,我们生成的图像分别实现了约 18.0% 和 12.5% 的互动提升,人类评估对比进一步证实我们的模型在这些任务上优于第三方模型。最后,我们展示了其他 Canvas 变体,包括多图像场景合成和图像到视频生成,表明我们的做法能够泛化到广泛的潜在下游任务。
引用
@article{arxiv.2603.06453,
title = {Pinterest Canvas: Large-Scale Image Generation at Pinterest},
author = {Yu Wang and Eric Tzeng and Raymond Shiau and Jie Yang and Dmitry Kislyuk and Charles Rosenberg},
journal= {arXiv preprint arXiv:2603.06453},
year = {2026}
}