中文

SciVid:跨域科学应用视频模型评估基准

计算机视觉与模式识别 2025-07-08 v1 人工智能 机器学习

摘要

近年来,随着不同科学学科中时空基础模型的涌现,虽有前景,但这些模型往往具有特定领域性,且仅在设计其之的特定应用中得到评估。鉴于许多任务可表现为视频建模问题,视频基础模型(ViFMs)作为通用领域无关方法具备相当大的潜力。然而,尚不确定大规模但可能超出域的数据所获取的知识能否有效跨越多样化的科学学科,或单一的预训练 ViFM能否与特定领域的基线相当。为此,本文引入SciVid,一个涵盖医学计算机视觉、动物行为和气象预测等五个科学视频任务的综合性基准。我们采用简单的可训练读取模块将六大领先 ViFMs适配SciVid,建立了强有力的基线,展示了有效迁移学习的潜力。具体而言,我们表明通过利用 ViFM backbone 提供的通用表征,可在多个应用中获得最先进的结果。此外,我们的结果揭示了现有 ViFMs的局限性,并为开发面向高影响力科学应用的通用模型指明了机遇。我们在 https://github.com/google-deepmind/scivid 公开代码,以推动 ViFMs 开发的进一步研究。

关键词

引用

@article{arxiv.2507.03578,
  title  = {SciVid: Cross-Domain Evaluation of Video Models in Scientific Applications},
  author = {Yana Hasson and Pauline Luc and Liliane Momeni and Maks Ovsjanikov and Guillaume Le Moing and Alina Kuznetsova and Ira Ktena and Jennifer J. Sun and Skanda Koppula and Dilara Gokay and Joseph Heyward and Etienne Pot and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2507.03578},
  year   = {2025}
}

备注

ICCV 2025, GitHub repo: https://github.com/google-deepmind/scivid