融合自注意力与膨胀卷积用于煤层质构组的语义分割
计算机视觉与模式识别
2025-06-17 v1 图像与视频处理
摘要
煤层质构组的分割可描述为煤层质构组图像的语义分割过程,这在研究煤的化学性质方面具有重要意义。一般而言,现有的煤层质构组语义分割模型采用堆叠参数以实现更高精度,导致计算需求增加并影响模型训练效率。同时,由于煤层质构组图像的专业性和多样性,获取模型训练所需的样本数量需要较长时间和专业人员操作。为此,我们创新性地开发了基于物联网的 DA-VIT 并行网络模型。通过该模型,可通过物联网持续扩充数据集,从而实现对煤层质构组分割精度的持续提升。此外,我们将并行网络解耦于 backbone 网络,以确保在模型数据更新期间保持 backbone 网络的正常使用。其次,引入 DA-VIT 的 DCSA(Dilation Convolutional Self-attention)机制,以增强煤显微图像的局部特征信息。该 DCSA 可将大卷积核分解为多个尺度,从而降低 81.18% 的参数。最后,我们在多个评估指标上对 DA-VIT 与最先进方法进行了对比实验和消融实验。实验结果表明,DA-VIT-Base 实现了 92.14% 的像素准确率和 63.18% 的 mIoU。DA-VIT-Tiny 的参数数和 FLOPs 分别为 4.95M 和 8.99G。该提出方法在所有评估指标上均优于其他最先进方法。
关键词
引用
@article{arxiv.2506.12712,
title = {Combining Self-attention and Dilation Convolutional for Semantic Segmentation of Coal Maceral Groups},
author = {Zhenghao Xi and Zhengnan Lv and Yang Zheng and Xiang Liu and Zhuang Yu and Junran Chen and Jing Hu and Yaqi Liu},
journal= {arXiv preprint arXiv:2506.12712},
year = {2025}
}