中文

向文本引导图像生成注入多轮思考

计算机视觉与模式识别 2024-03-12 v2

摘要

本文深入探讨了文本引导图像编辑任务,重点关注根据用户指定的文本反馈修改参考图像以体现特定属性。尽管近期取得了进展,但一个持续的挑战是单轮生成常常忽略关键细节,尤其是在鞋子或袖子等细粒度变化方面。这一问题在多轮交互中会加剧,严重限制了定制质量。为应对这一挑战,我们引入了一种新的自监督正则化方法,即多轮正则化,它与现有方法兼容。具体而言,多轮正则化鼓励模型在不同修改顺序下保持一致性。它基于这样一个观察:修改顺序通常不应影响最终结果。与传统的单轮生成不同,支撑所提方法的机制是对最初在捕捉复杂细节时微小不准确性的误差放大。定性和定量实验证实,所提方法在单轮和多轮生成中均实现了高保真编辑质量,尤其是在局部修改方面,同时还展示了对不规则文本输入的鲁棒泛化能力。我们在 FahisonIQ 和 Fashion200k 上的检索改进进一步证实了其与文本反馈语义对齐的有效性。

关键词

引用

@article{arxiv.2401.08472,
  title  = {Instilling Multi-round Thinking to Text-guided Image Generation},
  author = {Lidong Zeng and Zhedong Zheng and Yinwei Wei and Tat-seng Chua},
  journal= {arXiv preprint arXiv:2401.08472},
  year   = {2024}
}

备注

14 pages, 6 figures