中文

ORACLE:基于扩散模型中LoRAs的一致性人物生成框架

计算机视觉与模式识别 2024-06-06 v1 机器学习

摘要

文本到图像扩散模型近期成为推动视觉创意跨领域发展的核心工具,涵盖漫画创作、儿童文学、游戏开发及网页设计等场景。这些模型运用人工智能将文本描述转化为逼真图像,使艺术家和创作者能够以前所未有的便捷性实现想象构想。然而,保持人物在不同情境下的一致性 remains 一个显著挑战——即使细微的文本提示变化也可能导致截然不同的视觉输出,这对需要统一人物表征的项目构成严峻问题。本文提出一种新型框架,能从单一文本提示生成跨场景的一致性人物表征。通过定量与定性分析,我们展示该框架在保持人物视觉身份一致性方面超越现有方法,凸显其在创意产业中的变革潜力。通过解决人物一致性关键问题,本工作不仅提升模型实用性,更拓宽了艺术与创意表达的边界。

关键词

引用

@article{arxiv.2406.02820,
  title  = {ORACLE: Leveraging Mutual Information for Consistent Character Generation with LoRAs in Diffusion Models},
  author = {Kiymet Akdemir and Pinar Yanardag},
  journal= {arXiv preprint arXiv:2406.02820},
  year   = {2024}
}