中文

RAVEL:基于图驱动关系引导的稀有概念生成与编辑

计算机视觉与模式识别 2025-12-30 v2 计算与语言

摘要

尽管在视觉保真度方面取得了显著进展,当前的文本到图像扩散模型因训练数据限制,难以描绘稀有、复杂或文化细节丰富的概念。我们提出了RAVEL,一个无需训练的框架,通过将基于图检索增强生成(RAG)集成到扩散管道中,显著提升稀有概念生成、上下文驱动的图像编辑和自我纠正能力。不同于依赖视觉示例、静态标题或模型预训练知识的先前RAG和大语言模型增强方法,RAVEL利用结构化知识图谱检索组合化、符号化和关系化上下文,实现即使在无视觉先验条件下的细粒度 grounding。为进一步细化生成质量,我们提出了SRD(Self-Refinement Module),通过多维度对齐反馈迭代更新提示词,增强属性准确性、叙事连贯性和语义忠实度。该框架具有模型无关性,兼容主流扩散模型,包括Stable Diffusion XL、Flux和DALL-E 3。我们在三个新提出的基准测试上进行了广泛评估——MythoBench、Rare-Concept-1K和NovelBench。RAVEL在感知、对齐和LLM评判等指标上 consistently 超越了SOTA方法。这些结果将RAVEL定位为处理长尾领域中可控且可解释文本到图像生成的强大范式。

关键词

引用

@article{arxiv.2412.09614,
  title  = {RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance},
  author = {Kavana Venkatesh and Yusuf Dalva and Ismini Lourentzou and Pinar Yanardag},
  journal= {arXiv preprint arXiv:2412.09614},
  year   = {2025}
}

备注

Project Page: https://ravel-diffusion.github.io/