E-M3RF:等变多模态 3D 重组框架
计算机视觉与模式识别
2025-11-27 v1
摘要
3D 重组是基本的几何问题,近年来正越来越受到深度学习方法的挑战,远超经典优化方法。尽管学习方法已显示出有前景的成果,但大多数方法仍主要依赖几何特征来将整体从碎片中拼合。结果是,当几何单独不足以或含糊不清时,方法会感到困难,例如对于小型、被侵蚀或对称碎片。此外,解决方案不会施加物理约束以显式防止重叠组装。为此,我们引入 E-M3RF,一种等变多模态 3D 重组框架,该框架以点云为输入,点云包含碎片的点位置和颜色,并预测用于重组的变换,使用 SE(3) 流匹配。每个碎片由几何和颜色特征表示:i) 3D 点位置编码为旋转一致的几何特征,使用旋转等变编码器;ii) 每个 3D 点的颜色使用 Transformer 编码。随后将两种特征集合融合以形成多模态表示。我们在四个数据集上进行实验:两个合成数据集 Breaking Bad 和 Fantastic Breaks,以及两个真实世界文化遗产数据集 RePAIR 和 Presious,结果表明 E-M3RF 在 RePAIR 数据集上相对于竞争方法将旋转误差降低 23.1%,平移误差降低 13.2%,而且 Chamfer Distance 降低 18.4%。
引用
@article{arxiv.2511.21422,
title = {E-M3RF: An Equivariant Multimodal 3D Re-assembly Framework},
author = {Adeela Islam and Stefano Fiorini and Manuel Lecha and Theodore Tsesmelis and Stuart James and Pietro Morerio and Alessio Del Bue},
journal= {arXiv preprint arXiv:2511.21422},
year = {2025}
}