中文

LumiX:结构化且连贯的文本到内在生成

计算机视觉与模式识别 2025-12-03 v1 图形学 机器学习

摘要

我们提出 LumiX,一个用于连贯文本到内在生成的结构化扩散框架。以文本提示为条件,LumiX 联合生成一整套内在图(例如,反照率、 irradiance、法线、深度和最终颜色),为描述底层场景提供结构化且物理一致的描述。这得益于两个关键贡献:1)Query-Broadcast Attention,一种通过在每个自注意力块中跨所有图共享查询,确保结构一致性的机制;2)Tensor LoRA,一种基于张量的适配器,用于高效建模跨图关系,实现联合训练。通过这些设计,LumiX 能够实现稳定的联合扩散训练和统一的多属性生成。实验表明,LumiX 能产生连贯且具有物理意义的结果,相较于最先进的方法,在对齐度上提升 23%,更好的偏好得分(0.19 vs. -0.41),并且还能在同一框架内执行图像条件的内在分解。

关键词

引用

@article{arxiv.2512.02781,
  title  = {LumiX: Structured and Coherent Text-to-Intrinsic Generation},
  author = {Xu Han and Biao Zhang and Xiangjun Tang and Xianzhi Li and Peter Wonka},
  journal= {arXiv preprint arXiv:2512.02781},
  year   = {2025}
}

备注

The code will be available at https://github.com/xhanxu/LumiX