IPDN:用于三维指代表达式分割的图像增强提示解码网络
计算机视觉与模式识别
2025-01-10 v1 人工智能
摘要
三维指代表达式分割(3D-RES)旨在根据给定的表达式对点云场景进行分割。然而,现有的 3D-RES 方法面临两大主要挑战:特征模糊性和意图模糊性。特征模糊性源于点云采集过程中由于光照和视角等限制所造成的信息丢失或失真。意图模糊性是指模型在解码过程中对所有查询一视同仁,缺乏自顶向下的任务特定指导。本文引入了一种图像增强提示解码网络(IPDN),它利用多视图图像和任务驱动信息来增强模型的推理能力。为了解决特征模糊性问题,我们提出了多视图语义嵌入(MSE)模块,将多视图二维图像信息注入三维场景,补偿潜在的空间信息损失。为了解决意图模糊性问题,我们设计了提示感知解码器(PAD),通过从表达式与视觉特征的交互中提取任务驱动信号来引导解码过程。全面的实验表明,IPDN 在 3D-RES 和 3D-GRES 任务的 mIoU 指标上分别以 1.9 和 4.2 分优于当前最先进的方法。
引用
@article{arxiv.2501.04995,
title = {IPDN: Image-enhanced Prompt Decoding Network for 3D Referring Expression Segmentation},
author = {Qi Chen and Changli Wu and Jiayi Ji and Yiwei Ma and Danni Yang and Xiaoshuai Sun},
journal= {arXiv preprint arXiv:2501.04995},
year = {2025}
}
备注
AAAI 2025