面向实用性的多模态对比学习:用于产品图像生成的效用感知方法
人工智能
2026-05-28 v1
摘要
产品图像在线上市场中对消费者决策具有强大的影响力。受多模态对比学习的赋能,生成式 AI 可以输出与文本提示高度一致的图像。然而,现有的生成式 AI 模型并未直接优化市场绩效。这一局限性至关重要,因为语义对齐本身并不保证图像能够实现销售。为此,我们提出了一种\textit{效用感知多模态对比学习}框架,纳入消费者需求以纠正效用感知 InfoNCE 损失。优化这一效用感知目标可引导生成过程,使图像在语义一致性和需求驱动性之间取得平衡。这一效果直接源于所学图像-文本表示空间向需求驱动的视觉线索的偏移,我们也通过所提目标函数的理论界限进行了验证。在亚马逊和 Airbnb 上的下游应用中,我们的方法生成并编辑的产品图像在提升需求、保持图像保真度的同时,也优于最先进的模型在文本-图像一致性方面表现。值得注意的是,我们的效用感知框架保留了对诸如美学和独特性等属性的反 U 形需求模式的保持,提高了基于需求的性能,同时保持了图像保真度和语义一致性。人类被试实验进一步验证了其商业有效性。随着生成式 AI 技术的不断演进,我们的效用感知组件可以灵活地嵌入到新出现的生成模型中,以提高其直接商业应用。
引用
@article{arxiv.2605.28733,
title = {Utility-Aware Multimodal Contrastive Learning for Product Image Generation},
author = {Xiaohang Feng and Yiling Xie},
journal= {arXiv preprint arXiv:2605.28733},
year = {2026}
}