RelaxFlow:面向文本驱动的无遮挡 3D 生成
计算机视觉与模式识别
2026-05-28 v2 人工智能
摘要
图像到 3D 的生成面临遮挡下的本质语义歧义,部分观察往往不足以确定物体类别。本文正式定义了文本驱动的无遮挡 3D 生成,其中文本提示引导不可见区域的完成,同时严格保留输入观察。关键在于,这些目标要求不同的控制粒度:针对观察的刚性控制与针对提示的放松结构控制。为此,我们提出了 RelaxFlow,一个无训练的双分支框架,通过**多先验共识模块**和**放松机制**解耦控制粒度。理论上,我们证明了该放松等效于对生成向量场施加低通滤波器,这抑制了高频实例细节,以隔离能容纳观察的几何结构。为便于评估,我们引入了两个诊断基准:**ExtremeOcc-3D** 和 **AmbiSem-3D**。大量实验表明,RelaxFlow 成功地将不可见区域的生成引导至匹配提示意图,同时保持视觉保真度。
引用
@article{arxiv.2603.05425,
title = {RelaxFlow: Text-Driven Amodal 3D Generation},
author = {Jiayin Zhu and Guoji Fu and Xiaolu Liu and Qiyuan He and Yicong Li and Angela Yao},
journal= {arXiv preprint arXiv:2603.05425},
year = {2026}
}
备注
Accepted as a spotlight presentation at ICML 2026. Code: https://github.com/viridityzhu/RelaxFlow