中文

NEGATE:文本到视频扩散中语言否定的约束语义引导

计算机视觉与模式识别 2026-03-09 v1

摘要

否定是一种基本的语言算子,但在基于扩散的生成系统中仍未得到充分建模。在这项工作中,我们通过对扩散动力学中的语义引导施加结构化可行性约束,对基于扩散的生成模型中的语言否定进行了形式化处理。我们没有引入启发式方法或重新训练模型参数,而是将无分类器引导重新解释为定义语义更新方向,并通过将更新投影到从语言结构导出的凸约束集上来强制执行否定。这种新颖的公式化为处理多样的否定现象提供了一个统一框架,包括对象缺失、分级非反转语义、多重否定组合和范围敏感消歧。我们的方法无需训练,与预训练的扩散骨干网络兼容,并且自然地从图像生成扩展到时间演变的视频轨迹。此外,我们引入了一个结构化的以否定为中心的基准套件,该套件隔离了生成系统中的不同语言失败模式,以推动该领域的进一步研究。实验表明,我们的方法在保持视觉保真度和结构一致性的同时,实现了稳健的否定遵从性,建立了基于扩散的生成模型中语言否定的首个统一公式,超越了表示层面的评估。

关键词

引用

@article{arxiv.2603.06533,
  title  = {NEGATE: Constrained Semantic Guidance for Linguistic Negation in Text-to-Video Diffusion},
  author = {Taewon Kang and Ming C. Lin},
  journal= {arXiv preprint arXiv:2603.06533},
  year   = {2026}
}

备注

50 pages, 32 figures