中文

UniSemAlign:基于基础编码器的文本-原型对齐用于半监督组织病学切片分割

计算机视觉与模式识别 2026-04-13 v1

摘要

计算病理学中的半监督语义分割因稀缺的像素级标注和不可靠的伪标签监督而具有挑战性。我们提出了 UniSemAlign,一个双模态语义对齐框架,通过向像素级学习注入显式的类别级结构来增强视觉分割。基于病理学预训练的 Transformer 编码器,UniSemAlign 在共享嵌入空间中引入互补的原型级和文本级对齐分支,提供结构化指导以减少类别歧义并稳定伪标签细化。对齐后的表示与视觉预测融合,以生成更可靠的监督,用于标记组织病学图像。该框架以监督分割、跨视图一致性和跨模态对齐目标进行 end-to-end 训练。在 GlaS 和 CRAG 数据集上进行的大量实验表明,UniSemAlign 在有限监督下显著优于最新的半监督基线方法,在 GlaS 上 Dice 提升最高可达 2.6%2.6\%,在 CRAG 上提升最高可达 8.6%8.6\%,且在 20% 监督下也表现出强大的改进。代码已公开:https://github.com/thailevann/UniSemAlign

关键词

引用

@article{arxiv.2604.09169,
  title  = {UniSemAlign: Text-Prototype Alignment with a Foundation Encoder for Semi-Supervised Histopathology Segmentation},
  author = {Le-Van Thai and Tien Dat Nguyen and Hoai Nhan Pham and Lan Anh Dinh Thi and Duy-Dong Nguyen and Ngoc Lam Quang Bui},
  journal= {arXiv preprint arXiv:2604.09169},
  year   = {2026}
}

备注

Accepted at CVPR 2026 Workshop. 11 pages, 5 figures, 4 tables