Easi3R:无需训练从DUSt3R中估计解耦运动
计算机视觉与模式识别
2025-10-02 v3
摘要
DUSt3R的最新进展实现了对静态场景的密集点云和相机参数的鲁棒估计,这得益于Transformer网络架构和大规模3D数据集上的直接监督。相比之下,可用4D数据集的规模和多样性有限,成为训练高泛化4D模型的主要瓶颈。这一限制促使传统4D方法在可扩展的动态视频数据上微调3D模型,并引入光流和深度等额外几何先验。在本工作中,我们采取相反的路径,引入了Easi3R,一种简单而高效的免训练4D重建方法。我们的方法在推理时应用注意力适配,无需从头预训练或网络微调。我们发现DUSt3R中的注意力层本质上编码了关于相机和物体运动的丰富信息。通过仔细解耦这些注意力图,我们实现了精确的动态区域分割、相机位姿估计和4D密集点图重建。在真实世界动态视频上的大量实验表明,我们的轻量级注意力适配显著优于先前在大量动态数据集上训练或微调的最先进方法。我们的代码已公开用于研究目的,网址为 https://easi3r.github.io/
引用
@article{arxiv.2503.24391,
title = {Easi3R: Estimating Disentangled Motion from DUSt3R Without Training},
author = {Xingyu Chen and Yue Chen and Yuliang Xiu and Andreas Geiger and Anpei Chen},
journal= {arXiv preprint arXiv:2503.24391},
year = {2025}
}
备注
Page: https://easi3r.github.io/ Code: https://github.com/Inception3D/Easi3R