LumiX:结构化且连贯的文本到内在生成
计算机视觉与模式识别
2025-12-03 v1 图形学
机器学习
摘要
我们提出 LumiX,一个用于连贯文本到内在生成的结构化扩散框架。以文本提示为条件,LumiX 联合生成一整套内在图(例如,反照率、 irradiance、法线、深度和最终颜色),为描述底层场景提供结构化且物理一致的描述。这得益于两个关键贡献:1)Query-Broadcast Attention,一种通过在每个自注意力块中跨所有图共享查询,确保结构一致性的机制;2)Tensor LoRA,一种基于张量的适配器,用于高效建模跨图关系,实现联合训练。通过这些设计,LumiX 能够实现稳定的联合扩散训练和统一的多属性生成。实验表明,LumiX 能产生连贯且具有物理意义的结果,相较于最先进的方法,在对齐度上提升 23%,更好的偏好得分(0.19 vs. -0.41),并且还能在同一框架内执行图像条件的内在分解。
引用
@article{arxiv.2512.02781,
title = {LumiX: Structured and Coherent Text-to-Intrinsic Generation},
author = {Xu Han and Biao Zhang and Xiangjun Tang and Xianzhi Li and Peter Wonka},
journal= {arXiv preprint arXiv:2512.02781},
year = {2025}
}
备注
The code will be available at https://github.com/xhanxu/LumiX