中文

FlowSeek:基于深度基础模型和运动基底的光流更易实现

计算机视觉与模式识别 2025-09-08 v1 人工智能

摘要

我们提出了 FlowSeek,一个仅需最小硬件资源即可训练的光流框架。FlowSeek 将最新光流网络设计空间的进展与前沿单图像深度基础模型相结合,并采用经典低维运动参数化方法,实现紧凑而准确的架构。FlowSeek 在单块消费级 GPU 上训练——硬件预算约为最近大多数方法的 1/8,仍在 Sintel Final 和 KITTI 上实现优异的跨数据集泛化,相较于前沿方法 SEA-RAFT 分别提升约 10% 和 15%,并在 Spring 和 LayeredFlow 数据集上取得优异成绩。

关键词

引用

@article{arxiv.2509.05296,
  title  = {WinT3R: Window-Based Streaming Reconstruction with Camera Token Pool},
  author = {Zizun Li and Jianjun Zhou and Yifan Wang and Haoyu Guo and Wenzheng Chang and Yang Zhou and Haoyi Zhu and Junyi Chen and Chunhua Shen and Tong He},
  journal= {arXiv preprint arXiv:2509.05296},
  year   = {2025}
}