Utonia:通向全点云统一编码器
计算机视觉与模式识别
2026-03-04 v1
摘要
我们梦想着未来的某一天,来自所有领域的点云能够汇聚到单一模型中,惠及于所有数据。为此目标,我们提出Utonia——迈出训练跨领域自监督点变换器编码器的第一步,涵盖遥感、户外LiDAR、室内RGB-D序列、对象中心CAD模型以及从RGB视频中提取的点云。尽管它们具有不同的感知几何、密度和先验,Utonia学习到的一致表示空间能够跨领域迁移。这种统一性在感知能力方面带来提升,同时揭示了只有在跨域联合训练时才会出现的有趣的涌现行为。除感知外,我们观察到Utonia表示也能惠及具身和多模态推理:基于Utonia特征对视觉-语言-动作策略进行条件化,可提升机器人操控效果;将其集成到视觉-语言模型中,可在空间推理任务上取得提升。我们希望Utonia能够作为稀疏3D数据的基础模型的一步步浪,支持AR/VR、机器人和自动驾驶等下游应用。
引用
@article{arxiv.2603.03283,
title = {Utonia: Toward One Encoder for All Point Clouds},
author = {Yujia Zhang and Xiaoyang Wu and Yunhan Yang and Xianzhe Fan and Han Li and Yuechen Zhang and Zehao Huang and Naiyan Wang and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2603.03283},
year = {2026}
}
备注
produced by Pointcept, project page: https://pointcept.github.io/Utonia