CritiFusion:用于忠实文生图的语义批判与频谱对齐
计算机视觉与模式识别
2026-01-01 v2
摘要
最近的文生图扩散模型在视觉保真度方面取得了显著成就,但通常难以与复杂提示实现语义对齐。我们引入了CritiFusion,一种新颖的推理时框架,它集成了多模态语义批判机制和频域细化,以提高文生图的一致性和细节。所提出的CritiCore模块利用视觉语言模型和多个大语言模型来丰富提示上下文并产生高层语义反馈,引导扩散过程更好地将生成内容与提示意图对齐。此外,SpecFusion在频谱域合并中间生成状态,注入粗略的结构信息,同时保留高频细节。无需额外的模型训练。CritiFusion作为一个插件式细化阶段,与现有的扩散骨干网络兼容。在标准基准上的实验表明,我们的方法显著提高了文生图对应性和视觉质量的人类对齐指标。CritiFusion持续提升了人类偏好分数和美学评估的性能,达到了与最先进的奖励优化方法相当的结果。定性结果进一步展示了卓越的细节、真实感和提示保真度,表明了我们语义批判和频谱对齐策略的有效性。
引用
@article{arxiv.2512.22681,
title = {CritiFusion: Semantic Critique and Spectral Alignment for Faithful Text-to-Image Generation},
author = {ZhenQi Chen and TsaiChing Ni and YuanFu Yang},
journal= {arXiv preprint arXiv:2512.22681},
year = {2026}
}