SeqTex: 在视频序列中生成网格纹理
计算机视觉与模式识别
2025-07-08 v1 人工智能
图形学
摘要
训练原生3D纹理生成模型仍然是一个基础但具有挑战性的问题,这主要是由于大规模、高质量3D纹理数据集的可用性有限。这种稀缺性阻碍了其在现实场景中的泛化能力。为了解决这个问题,大多数现有方法微调基础图像生成模型以利用其学习到的视觉先验。然而,这些方法通常仅生成多视图图像,并依赖后处理来生成UV纹理图——这是现代图形管线中的一种基本表示。这种两阶段管线通常会在3D表面遭受误差累积和空间不一致性。在本文中,我们介绍了SeqTex,一种新颖的端到端框架,它利用预训练视频基础模型中编码的视觉知识直接生成完整的UV纹理图。与先前孤立建模UV纹理分布的方法不同,SeqTex将任务重新表述为一个序列生成问题,使模型能够学习多视图渲染和UV纹理的联合分布。这种设计有效地将来自视频基础模型的一致图像空间先验转移到UV域。为了进一步提升性能,我们提出了若干架构创新:解耦的多视图和UV分支设计、用于引导跨域特征对齐的几何感知注意力,以及用于在保持计算效率的同时保留精细纹理细节的自适应令牌分辨率。这些组件共同使SeqTex能够充分利用预训练视频先验,并合成高保真度的UV纹理图,而无需后处理。大量实验表明,SeqTex在图像条件和文本条件下的3D纹理生成任务上均达到了最先进的性能,具有卓越的3D一致性、纹理-几何对齐和现实世界泛化能力。
引用
@article{arxiv.2507.04285,
title = {SeqTex: Generate Mesh Textures in Video Sequence},
author = {Ze Yuan and Xin Yu and Yangtian Sun and Yuan-Chen Guo and Yan-Pei Cao and Ding Liang and Xiaojuan Qi},
journal= {arXiv preprint arXiv:2507.04285},
year = {2025}
}