驾驭三空间张力:基于 ARC 引导的幻觉建模与控制用于文本到图像生成
计算机视觉与模式识别
2025-10-01 v3 计算与语言
摘要
尽管在图像质量和提示保真度方面取得了显著进展,文本到图像(T2I)扩散模型仍然持续表现出“幻觉”,即生成内容与预期提示语义存在细微或显著的偏差。虽然这些失败通常被视为不可预测的伪影,但我们认为它们反映了生成过程中更深层次的结构性错位。在这项工作中,我们提出了一种受认知启发的视角,将幻觉重新解释为潜在对齐空间中的轨迹漂移。经验观察表明,生成过程在一个多轴的认知张力场中展开,模型必须在该场中持续协调三个关键轴上的竞争性需求:语义连贯性、结构对齐和知识基础。然后,我们将这个三轴空间形式化为幻觉三空间,并引入对齐风险码(ARC):一种动态向量表示,用于量化生成过程中的实时对齐张力。ARC 的大小捕捉整体错位,其方向识别主导失败轴,其不平衡反映张力不对称。基于此公式,我们开发了 TensionModulator(TM-ARC):一个完全在潜在空间中运行的轻量级控制器。TM-ARC 监控 ARC 信号,并在采样过程中应用有针对性的、特定于轴的干预。在标准 T2I 基准上的大量实验表明,我们的方法在不影响图像质量或多样性的情况下显著减少了幻觉。该框架为理解和缓解基于扩散的 T2I 系统中的生成失败提供了一种统一且可解释的方法。
引用
@article{arxiv.2507.04946,
title = {Taming the Tri-Space Tension: ARC-Guided Hallucination Modeling and Control for Text-to-Image Generation},
author = {Jianjiang Yang and Ziyan Huang and Yanshu li and Da Peng and Huaiyuan Yao},
journal= {arXiv preprint arXiv:2507.04946},
year = {2025}
}
备注
9 pages,6 figures,7 tables