中文

基于深度感知跨注意力的声学井眼图像弱监督多模态分割

计算机视觉与模式识别 2026-03-24 v1 人工智能 地球物理

摘要

声学井眼图像提供高分辨率的井壁结构,但大规模解释仍然困难,因为稀缺的密集专家标注以及次表层信息本质上是多模态的。挑战在于开发弱监督方法,将二维图像纹理与深度对齐的一维测井日志组合在一起。我们引入一种弱监督多模态分割框架,通过学习模型细化阈值引导的伪标签。这保留了经典阈值和聚类工作流程的无标注特性,同时通过去噪、置信感知伪超级监督和物理结构融合进行扩展。我们确立,阈值引导的学习细化对原始阈值、去噪阈值和潜在聚类基线提供了最可靠的改进。多模态性能高度依赖于融合策略:直接拼接提供有限的提升,而深度感知跨注意力、门控融合和置信感知调制显著提高了与弱监督参考的一致性。最强的模型是置信感知门控深度感知跨注意力(CG-DCA),在阈值基准、仅图像和早期多模态基准中均表现优于。针对性消融实验表明,其优势具体取决于置信感知融合和结构化局部深度相互作用,而非模型复杂度alone。跨井分析确认,这一性能在广泛稳定。这些结果建立了一个实用、可扩展的框架用于无标注分割,表明在辅助日志选择性地被整合时,才能最大化多模态改进,并在深度感知下实现。

关键词

引用

@article{arxiv.2603.20729,
  title  = {Weakly supervised multimodal segmentation of acoustic borehole images with depth-aware cross-attention},
  author = {Jose Luis Lima de Jesus Silva},
  journal= {arXiv preprint arXiv:2603.20729},
  year   = {2026}
}