3D-DRES:详细 3D 指代表达式分割
计算机视觉与模式识别
2026-03-04 v1
摘要
当前的 3D 视觉 grounding 任务仅处理句子级别的检测或分割,严重未能利用自然语言表达式中丰富的组合化语境推理。为此,我们提出详细 3D 指代表达式分割 (3D-DRES) 新任务,提供从短语到 3D 实例的映射,旨在增强细粒度的 3D 视觉语言理解能力。为支撑 3D-DRES,我们构建了 DetailRefer 数据集,包含 54,432 条描述,覆盖 11,054 个独立实体。与先前数据集不同,DetailRefer 实施了首创性的短语-实体标注范式,明确将每个被指代名词短语映射到其对应的 3D 元素。此外,我们引入 DetailBase,一个经过精心设计的简洁而有效的基线架构,支持句子和短语两个层面的分割。我们的实验结果表明,在 DetailRefer 上训练的模型不仅在短语级别分割方面表现出色,也在传统的 3D-RES 数据集上展现出惊人的性能提升。
引用
@article{arxiv.2603.02896,
title = {3D-DRES: Detailed 3D Referring Expression Segmentation},
author = {Qi Chen and Changli Wu and Jiayi Ji and Yiwei Ma and Liujuan Cao},
journal= {arXiv preprint arXiv:2603.02896},
year = {2026}
}
备注
AAAI2026