SHREC 2025:面向多模态增强语言与空间辅助的最优物体检索(ROOMELSA)
计算机视觉与模式识别
2025-08-13 v1
摘要
近期的3D检索系统通常是为简单、受控的场景设计的,例如从裁剪图像或简短描述中识别物体。然而,现实世界的场景更为复杂,通常需要根据模糊、自由形式的描述在杂乱场景中识别物体。为此,我们提出了ROOMELSA,这是一个旨在评估系统解释自然语言能力的新基准。具体而言,ROOMELSA关注全景房间图像中的特定区域,并从大型数据库中准确检索相应的3D模型。此外,ROOMELSA包含超过1600个公寓场景、近5200个房间和超过44000个目标查询。从经验上看,虽然粗粒度的物体检索已基本解决,但只有一个表现最佳的模型在几乎所有测试用例中都能始终将正确匹配项排在首位。值得注意的是,一个轻量级的基于CLIP的模型也表现良好,尽管它在材料、部件结构和上下文线索的细微变化方面存在困难,导致偶尔出错。这些发现凸显了紧密整合视觉与语言理解的重要性。通过弥合场景级定位与细粒度3D检索之间的差距,ROOMELSA为推进鲁棒的现实世界3D识别系统建立了一个新基准。
引用
@article{arxiv.2508.08781,
title = {SHREC 2025: Retrieval of Optimal Objects for Multi-modal Enhanced Language and Spatial Assistance (ROOMELSA)},
author = {Trong-Thuan Nguyen and Viet-Tham Huynh and Quang-Thuc Nguyen and Hoang-Phuc Nguyen and Long Le Bao and Thai Hoang Minh and Minh Nguyen Anh and Thang Nguyen Tien and Phat Nguyen Thuan and Huy Nguyen Phong and Bao Huynh Thai and Vinh-Tiep Nguyen and Duc-Vu Nguyen and Phu-Hoa Pham and Minh-Huy Le-Hoang and Nguyen-Khang Le and Minh-Chinh Nguyen and Minh-Quan Ho and Ngoc-Long Tran and Hien-Long Le-Hoang and Man-Khoi Tran and Anh-Duong Tran and Kim Nguyen and Quan Nguyen Hung and Dat Phan Thanh and Hoang Tran Van and Tien Huynh Viet and Nhan Nguyen Viet Thien and Dinh-Khoi Vo and Van-Loc Nguyen and Trung-Nghia Le and Tam V. Nguyen and Minh-Triet Tran},
journal= {arXiv preprint arXiv:2508.08781},
year = {2025}
}