中文

RelaxFlow:面向文本驱动的无遮挡 3D 生成

计算机视觉与模式识别 2026-05-28 v2 人工智能

摘要

图像到 3D 的生成面临遮挡下的本质语义歧义,部分观察往往不足以确定物体类别。本文正式定义了文本驱动的无遮挡 3D 生成,其中文本提示引导不可见区域的完成,同时严格保留输入观察。关键在于,这些目标要求不同的控制粒度:针对观察的刚性控制与针对提示的放松结构控制。为此,我们提出了 RelaxFlow,一个无训练的双分支框架,通过**多先验共识模块**和**放松机制**解耦控制粒度。理论上,我们证明了该放松等效于对生成向量场施加低通滤波器,这抑制了高频实例细节,以隔离能容纳观察的几何结构。为便于评估,我们引入了两个诊断基准:**ExtremeOcc-3D** 和 **AmbiSem-3D**。大量实验表明,RelaxFlow 成功地将不可见区域的生成引导至匹配提示意图,同时保持视觉保真度。

关键词

引用

@article{arxiv.2603.05425,
  title  = {RelaxFlow: Text-Driven Amodal 3D Generation},
  author = {Jiayin Zhu and Guoji Fu and Xiaolu Liu and Qiyuan He and Yicong Li and Angela Yao},
  journal= {arXiv preprint arXiv:2603.05425},
  year   = {2026}
}

备注

Accepted as a spotlight presentation at ICML 2026. Code: https://github.com/viridityzhu/RelaxFlow