Lookalike3D:3D 中的看双人
计算机视觉与模式识别
2026-03-27 v1
摘要
3D 对象理解与生成方法取得了令人印象深刻的结果,但常常忽视了现实场景中一种普遍的信息来源:重复对象。我们提出了室内场景中相似对象检测的任务,该任务利用来自相同或近似相同对象对的重复且互补的线索。给定输入场景,该任务需将对象对分类为相同、相似或不同。为解决此问题,我们提出了 Lookalike3D—a款有效区分此类对象对的多视图图像变换器,通过利用大规模图像基础模型中的强语义先验实现。为支持该任务,我们收集了 3DTwins 数据集,包含 76,000 条手动标注的相同、相似和不同对象对,基于 ScanNet++ 构建。我们显示该方法在基线方法上实现了 104% 的 IoU 提升。我们演示了本方法如何改善下游任务,例如实现联合 3D 对象重建和部分共分割,将重复且相似的对象转化为一致高质量 3D 感知的有力线索。我们的代码、数据集和模型将公开提供。
引用
@article{arxiv.2603.24713,
title = {Lookalike3D: Seeing Double in 3D},
author = {Chandan Yeshwanth and Angela Dai},
journal= {arXiv preprint arXiv:2603.24713},
year = {2026}
}
备注
Project page: https://cy94.github.io/lookalike3d/, Video: https://www.youtube.com/watch?v=g6S7J0y_52U