位置编码场
计算机视觉与模式识别
2025-10-24 v1
摘要
扩散转换器 (DiT) 已成为视觉生成领域的主导架构, 为图像和视频模型提供了最先进的性能。通过将图像表示为带有位置编码 (PE) 的补丁标记, DiT 将转换器的可扩展性与空间和时间归纳偏置相结合。在本工作中, 我们重新审视了 DiT 如何组织视觉内容的机制, 并发现补丁标记具有惊人的独立性:即使扰动了 PE, DiT 仍能产生全局一致的输出, 这表明空间一致性主要由 PE 控制。基于此发现, 我们引入位置编码场 (PE-Field), 将位置编码从二维平面扩展到结构化的三维场。PE-Field 包含深度感知编码用于体积推理, 以及层次编码用于细粒度子补丁控制, 使 DiT 能够在三维空间中直接建模几何结构。我们在单图像新视角合成和可控空间图像编辑任务上实现了最先进的性能。
引用
@article{arxiv.2510.20385,
title = {Positional Encoding Field},
author = {Yunpeng Bai and Haoxiang Li and Qixing Huang},
journal= {arXiv preprint arXiv:2510.20385},
year = {2025}
}
备注
8 pages, 9 figures