中文

探索视觉语言模型用于开放词汇零样本动作分割

星系天体物理 2026-02-26 v1

摘要

时间动作分割(Temporal Action Segmentation, TAS)需要将视频划分为动作片段,但活动的广泛空间和替代划分方式使得收集全面数据集不可行。现有方法局限于封闭词汇和固定标签集合。在本工作中,我们探索了利用视觉语言模型(Vision-Language Models, VLMs)的强大零样本能力,应用于开放词汇零样本时间动作分割(Open-Vocabulary Zero-Shot Temporal Action Segmentation, OVTAS)问题。我们引入一种无训练的管道,遵循基于分类的分割设计:帧-动作嵌入相似度(Frame-Action Embedding Similarity, FAES)将视频帧匹配到候选动作标签,相似度矩阵时间分割(Similarity-Matrix Temporal Segmentation, SMTS)强制实现时间一致性。除提出 OVTAS 之外,我们还对 14 种多样化的 VLMs 进行系统性研究,首次对其在开放词汇动作分割中的适用性进行广泛分析。在标准基准测试上进行实验,OVTAS 在无任务特定监督的情况下取得了强劲的性能,凸显了 VLMs 对于结构化时序理解的潜力。

关键词

引用

@article{arxiv.2602.21405,
  title  = {The turbulence driving mode in NGC7793 and NGC1313},
  author = {Lewis J Miller and Kathryn Grasha and Christoph Federrath},
  journal= {arXiv preprint arXiv:2602.21405},
  year   = {2026}
}

备注

18 pages, 9 figures, 3 tables, accepted for publication by MNRAS (19/02/26), results presented at Stellar Origins 2025