MSEG-VCUQ:基于增强视觉基础模型、卷积神经网络与不确定性量化的高速视频相位检测多模态分割
计算机视觉与模式识别
2026-03-17 v5 机器学习
图像与视频处理
摘要
高速视频(HSV)相位检测(PD)分割对于监测工业过程中的气相、液相和微层相至关重要。虽然基于 CNN 的模型(如 U-Net)在简化的阴影图两相流(TPF)分析中取得成功,但其在复杂 HSV PD 任务中的应用仍未被探索,视觉基础模型(VFM)也尚未解决基于阴影图或 PD 的 TPF 视频分割的复杂性。现有不确定性量化(UQ)方法缺乏像素级可靠性,难以支撑接触线密度和干燥面积分数等关键指标,且缺乏针对 PD 分割的大规模多模态实验数据集,进一步阻碍了进展。为填补这些空白,我们提出 MSEG-VCUQ。该混合框架将基于 U-Net 的 CNN 与基于 Transformer 的 Segment Anything Model (SAM) 集成,实现增强的分割精度和跨模态泛化。我们的方法引入系统化 UQ 以进行稳健误差评估,并发布首个开源多模态 HSV PD 数据集。实证结果表明 MSEG-VCUQ 超越基线 CNN 和 VFM,为真实沸腾动力学提供可扩展、可靠的 PD 分割。
引用
@article{arxiv.2411.07463,
title = {MSEG-VCUQ: Multimodal SEGmentation with Enhanced Vision Foundation Models, Convolutional Neural Networks, and Uncertainty Quantification for High-Speed Video Phase Detection Data},
author = {Chika Maduabuchi and Ericmoore Jossou and Matteo Bucci},
journal= {arXiv preprint arXiv:2411.07463},
year = {2026}
}