中文

复兴稠密材料分割:稳定化视觉 Transformer 与泛化悖论

计算机视觉与模式识别 2026-05-25 v1

摘要

材料分割是计算机视觉中像素级分类物理表面属性的挑战性问题,要求与对象中心化解析不同的数据驱动理解。尽管引入了严谨的 Apple 稠密材料分割 (DMS) 数据集,基准测试仍因attrition和停滞而受到影响,日益被几何偏置的基础模型所掩盖。本文复兴了 Apple-DMS 数据集,建立现代视觉 Transformer 的基准。我们对 SegFormer 和 Mask2Former 架构进行详尽评估,发现标准训练范式因高方差梯度无法在非晶纹理字段上取得好结果。为此,我们引入了高保真逻辑投影、查询熵正则化以及领域特定的物理合规数据增强管线等稳定化训练方案。我们的优化 SegFormer-B5 在原始数据集分割上取得了 0.4572 mIoU 的新型声学 (SOTA) 成绩,显著超越了以前的卷积基线。此外,我们识别出一个关键的“泛化悖论”:当将数据集重新划分为数据丰富的 80/10/10 比例时,指标升至 0.5276 mIoU,但专家定性分析显示这会导致分布均质化,严重损害实际的、离群分布的性能。通过发布我们恢复的数据集索引和健壮训练框架,我们表明材料感知仍未解决,并呼吁社区利用严格的原始划分推动以物理为导向的人工智能取得真正进展。

关键词

引用

@article{arxiv.2605.23747,
  title  = {Revitalizing Dense Material Segmentation: Stabilized Vision Transformers and the Generalization Paradox},
  author = {Allan Kazakov and Duygu Cakir and Hilal Kurt İrfanoğlu and Yavuz İrfanoğlu},
  journal= {arXiv preprint arXiv:2605.23747},
  year   = {2026}
}