SAMFlow: 利用 Segment Anything 模型消除光流中的任何碎片化
计算机视觉与模式识别
2023-12-22 v4
摘要
光流估计旨在寻找两帧之间的二维稠密运动场。由于模型结构与训练数据集的局限,现有方法往往过度依赖局部线索而忽略物体完整性,导致碎片化的运动估计。通过理论分析,我们发现预训练的大型视觉模型有助于光流估计,并注意到近期著名的 Segment Anything Model (SAM) 展现出分割完整物体的强大能力,适合解决碎片化问题。因此我们提出一种将冻结的 SAM 图像编码器嵌入 FlowFormer 以增强物体感知的方案。为应对在非分割任务(如光流估计)中深度利用 SAM 的挑战,我们提出一种光流任务专用适配(Optical Flow Task-Specific Adaption)方案,包括一个上下文融合模块(Context Fusion Module)用于将 SAM 编码器与光流上下文编码器融合,以及一个上下文适配模块(Context Adaption Module)利用学习到的任务专用嵌入(Learned Task-Specific Embedding)将 SAM 特征适配于光流任务。我们提出的 SAMFlow 模型在 Sintel 和 KITTI-15 训练集上达到 0.86/2.10 的 clean/final EPE 以及 3.55/12.32 的 EPE/F1-all,分别超越 FlowFormer 达 8.5%/9.9% 和 13.2%/16.3%。此外,我们的模型在 Sintel 和 KITTI-15 基准上取得了最先进(state-of-the-art)性能,在所有两帧方法中于 Sintel clean pass 上排名第一位。
引用
@article{arxiv.2307.16586,
title = {SAMFlow: Eliminating Any Fragmentation in Optical Flow with Segment Anything Model},
author = {Shili Zhou and Ruian He and Weimin Tan and Bo Yan},
journal= {arXiv preprint arXiv:2307.16586},
year = {2023}
}
备注
Accepted by AAAI 2024