中文

EPSegFZ:基于语言引导的少样本和零样本场景下的高效点云语义分割

计算机视觉与模式识别 2025-11-18 v1 图像与视频处理

摘要

最近的少样本 3D 点云语义分割方法通常需要两个阶段的学习过程,即预训练阶段 followed by 少样本训练阶段。虽然有效,但这些方法过度依赖于预训练,限制了模型的灵活性和适应性。一些模型尝试避免预训练,但未能捕获足够的信息。此外,当前方法关注支持集中的视觉信息,忽略或未充分利用其他有用数据,如文本注释。这种对支持信息的不充分利用削弱了模型性能并限制了其零样本能力。为此,我们提出一种新型无预训练网络,命名为 Efficient Point Cloud Semantic Segmentation for Few- and Zero-shot scenarios,即针对少样本和零样本场景的高效点云语义分割。我们的 EPSegFZ 包含三个关键组件。用于在无预训练条件下 improved feature提取和准确构建查询-原型对应关系的 Prototype-Enhanced Registers Attention (ProERA) 模块和基于 Dual Relative Positional Encoding (DRPE) 的跨注意力机制。一个 Language-Guided Prototype Embedding (LGPE) 模块,有效利用支持集中的文本信息以提高少样本性能并实现零样本推断。大量实验表明,我们的方法在 S3DIS 和 ScanNet 数据集上分别优于最先进的方法高出 5.68% 和 3.82%。

关键词

引用

@article{arxiv.2511.11700,
  title  = {EPSegFZ: Efficient Point Cloud Semantic Segmentation for Few- and Zero-Shot Scenarios with Language Guidance},
  author = {Jiahui Wang and Haiyue Zhu and Haoren Guo and Abdullah Al Mamun and Cheng Xiang and Tong Heng Lee},
  journal= {arXiv preprint arXiv:2511.11700},
  year   = {2025}
}

备注

AAAI 2026