基于熵融合的零样本主题中心生成用于创意应用
计算机视觉与模式识别
2025-03-17 v1 人工智能
图像与视频处理
摘要
生成模型在视觉内容创建中广泛应用。然而,当前文本到图像模型在实际应用中(如纺织图案设计和表情包生成)常面临挑战,因包含难以用现有方法分离的不需要的元素。与此同时,主题参考生成已成为关键研究趋势,凸显产生干净高质量主题图像并有效去除多余组件的技术需求。为此,我们提出了一个可靠的主题中心图像生成框架。本工作提出了一种基于熵的特征加权融合方法,用于合并来自 FLUX 预训练文本到图像模型每个抽样步骤中获得的交叉注意力特征,从而实现精确的掩码预测和主题中心生成。此外,我们开发了一个基于大语言模型(LLM)的智能体框架,将用户的随意输入翻译为更详细的提示,导致高度细致的图像生成。同时,智能体从提示中提取主要元素,以指导熵基于的特征融合,确保聚焦于主要元素生成而不包含多余组件。实验结果和用户研究表明,我们的方法生成的主题中心图像质量高于现有方法或其他可能的管道,凸显了该方法的有效性。
引用
@article{arxiv.2503.10697,
title = {Zero-Shot Subject-Centric Generation for Creative Application Using Entropy Fusion},
author = {Kaifeng Zou and Xiaoyi Feng and Peng Wang and Tao Huang and Zizhou Huang and Zhang Haihang and Yuntao Zou and Dagang Li},
journal= {arXiv preprint arXiv:2503.10697},
year = {2025}
}
备注
8 pages, 8 figure