语义分割的 Lorentz 框架
计算机视觉与模式识别
2026-04-21 v1 人工智能
机器学习
摘要
语义分割在双曲空间中实现可紧凑地建模层次结构,同时提供内在的不确定性量化。先前方法主要依赖于庞朗球模型,后者在数值稳定性、优化和计算方面存在挑战。我们提出了一种新颖的、可处理的、与体系结构无关的语义分割框架(像素级和掩码分类),在双曲 Lorentz 模型中实现。我们采用带有语义和视觉线索的文本嵌入来指导双曲 Lorentz 空间中的层次像素级表示。这使得在不要求 Riemannian 优化器的情况下实现稳定和高效的优化,并且轻松集成到现有的 Euclidean 架构中。除了分割之外,我们的方法还提供了免费的不确定性估计、置信度图、边界描绘、层次检索和基于文本的检索,以及零样本性能,达到更广泛的平坦最小值。我们在 Lorentz 锥嵌入中引入了一种新颖的不确定性和置信度指示器。进一步,我们提供了关于 Lorentz 优化的分析性和经验见解。广泛的实验在 ADE20K、COCO-Stuff-164k、Pascal-VOC 和 Cityscapes 上进行,利用最先进的像素级分类模型(DeepLabV3 和 SegFormer)和掩码分类模型(mask2former 和 maskformer)验证了我们方法的有效性和通用性。我们的结果表明,双曲 Lorentz 嵌入对于实现稳健且具不确定性感知的语义分割具有潜力。代码可在 https://github.com/mxahan/Lorentz_semantic_segmentation 获取。
关键词
引用
@article{arxiv.2604.16836,
title = {Lorentz Framework for Semantic Segmentation},
author = {Zahid Hasan and Masud Ahmed and Nirmalya Roy},
journal= {arXiv preprint arXiv:2604.16836},
year = {2026}
}