VideoSAM:用于高速视频分割的大型视觉基础模型
计算机视觉与模式识别
2025-02-07 v3 机器学习
摘要
高速视频(HSV)分割对于分析科学和工业应用(如沸腾传热)中的动态物理过程至关重要。像U-Net这样的现有模型在泛化能力和准确分割复杂气泡结构方面存在困难。我们提出了VideoSAM,这是Segment Anything Model(SAM)的一个专门改编版本,在用于相检测的多样化HSV数据集上进行了微调。通过多样化的实验,VideoSAM在四种流体环境(水、FC-72、氮气和氩气)中展现出优越的性能,在复杂分割任务中显著优于U-Net。除了介绍VideoSAM,我们还贡献了一个用于相检测的开源HSV分割数据集,以促进该领域的未来研究。我们的研究结果强调了VideoSAM在稳健和准确的高速视频分割方面树立新标准的潜力。本研究中使用的代码和数据集可在https://github.com/chikap421/videosam在线获取。
引用
@article{arxiv.2410.21304,
title = {VideoSAM: A Large Vision Foundation Model for High-Speed Video Segmentation},
author = {Chika Maduabuchi and Ericmoore Jossou and Matteo Bucci},
journal= {arXiv preprint arXiv:2410.21304},
year = {2025}
}
备注
Accepted at IEEE SSD 2025 (CSP Track)