基于图的语义次要结构表征学习:面向视觉分割的 SEMIR
计算机视觉与模式识别
2026-05-13 v1 人工智能
机器学习
摘要
分割大规模图像中的小而稀疏结构,本质上受限于基于体素的、受网格限制的计算以及极端类别不平衡——稠密、全分辨率的推理计算开销大,迫使大多数管道依赖固定区域划分或下采样,将计算成本与图像分辨率耦合,并削弱了在次要结构最具信息性处的边界证据。我们提出 SEMIR(Semantic Minor-Induced Representation Learning),一种从网格中解耦推理的表征学习框架,通过学习任务适应的、保持拓扑的潜在图表征并实现精确解码。SEMIR 将底层网格图转换为通过参数化边缘收缩、节点删除和边删除实现的紧凑、边界对齐的图的次要结构,同时保持从次要结构预测到晶格标签的精确提升映射。次要结构的构建 formalized 为 few-shot 结构学习问题,取代手工调优的预处理,通过最大化预测边界元素与目标特定语义边之间的一致性来学习次要结构参数,基于边界 Dice 准则;次要结构被标注为具有尺度和旋转鲁棒性的几何和强度描述符,支持通过带关系边特征的图神经网络(GNN)实现高效的区域级推理。我们在三个肿瘤分割数据集——BraTS 2021、KiTS23 和 LiTS——上进行基准测试,其中目标表现出高度结构变异和分布不确定性。SEMIR 在实际运行时实现了对次要结构 Dice 分数的一致性提升。更广泛地说,SEMIR 建立了一个学习任务适应的、保持拓扑的潜在表征框架,实现高分辨率结构视觉数据的精确解码。
引用
@article{arxiv.2605.12389,
title = {SEMIR: Semantic Minor-Induced Representation Learning on Graphs for Visual Segmentation},
author = {Luke James Miller and Yugyung Lee},
journal= {arXiv preprint arXiv:2605.12389},
year = {2026}
}
备注
20 pages, 3 figures. Accepted at ICML 2026. Includes appendices