中文

基于风格与内容参考零样本解耦的无训练与无提示通用绘画风格和谐化

计算机视觉与模式识别 2024-12-17 v2 人工智能 多媒体

摘要

绘画图像和谐化旨在将单幅图像中不同的视觉元素无缝融合。然而,以往的方法常因训练数据的限制或依赖额外提示而难以奏效,导致输出结果不和谐且内容受损。为克服这些障碍,我们设计了一种无训练与无提示的通用绘画和谐化方法(TF-GPH)。TF-GPH 引入了一种新颖的“相似性解耦掩码”,通过将前景内容和背景图像的注意力重定向至对应的参考图像,对二者进行解耦,从而增强了多图像输入的注意力机制。此外,我们提出了一种“相似性重加权”机制,以平衡风格化与内容保留之间的和谐化。该机制通过优先考虑给定背景风格参考中内容相似的特征,最小化了内容受损。最后,我们通过提出新颖的基于范围的评估指标和新基准,解决了现有基准的不足,以更好地反映实际应用。大量实验证明了我们的方法在所有基准上的有效性。更多详情见 https://github.com/BlueDyee/TF-GPH。

关键词

引用

@article{arxiv.2404.12900,
  title  = {Training-and-Prompt-Free General Painterly Harmonization via Zero-Shot Disentenglement on Style and Content References},
  author = {Teng-Fang Hsiao and Bo-Kai Ruan and Hong-Han Shuai},
  journal= {arXiv preprint arXiv:2404.12900},
  year   = {2024}
}