中文

Soulstyler:利用大语言模型引导目标对象的图像风格迁移

计算机视觉与模式识别 2023-11-30 v2 人工智能

摘要

图像风格迁移在计算机图形学与计算机视觉中均占有重要地位。然而,当前大多数方法需要参考已风格化图像,且无法对特定对象单独进行风格化。为克服此限制,我们提出“Soulstyler”框架,允许用户通过简单文本描述引导图像中特定对象的风格化。我们引入大语言模型(LLM)解析文本并识别风格化目标与具体风格。结合基于 CLIP 的语义视觉嵌入编码器,模型理解并匹配文本与图像内容。我们还提出一种新颖的局部文本-图像块匹配损失,确保风格迁移仅在指定目标对象上进行,而非目标区域保持原始风格。实验结果表明,我们的模型能够根据文本描述准确对目标对象进行风格迁移,且不影响背景区域风格。我们的代码将发布于 https://github.com/yisuanwang/Soulstyler。

关键词

引用

@article{arxiv.2311.13562,
  title  = {Soulstyler: Using Large Language Model to Guide Image Style Transfer for Target Object},
  author = {Junhao Chen and Peng Rong and Jingbo Sun and Chao Li and Xiang Li and Hongwu Lv},
  journal= {arXiv preprint arXiv:2311.13562},
  year   = {2023}
}

备注

5 pages,3 figures,ICASSP2024