探索视觉语言模型用于开放词汇零样本动作分割
星系天体物理
2026-02-26 v1
摘要
时间动作分割(Temporal Action Segmentation, TAS)需要将视频划分为动作片段,但活动的广泛空间和替代划分方式使得收集全面数据集不可行。现有方法局限于封闭词汇和固定标签集合。在本工作中,我们探索了利用视觉语言模型(Vision-Language Models, VLMs)的强大零样本能力,应用于开放词汇零样本时间动作分割(Open-Vocabulary Zero-Shot Temporal Action Segmentation, OVTAS)问题。我们引入一种无训练的管道,遵循基于分类的分割设计:帧-动作嵌入相似度(Frame-Action Embedding Similarity, FAES)将视频帧匹配到候选动作标签,相似度矩阵时间分割(Similarity-Matrix Temporal Segmentation, SMTS)强制实现时间一致性。除提出 OVTAS 之外,我们还对 14 种多样化的 VLMs 进行系统性研究,首次对其在开放词汇动作分割中的适用性进行广泛分析。在标准基准测试上进行实验,OVTAS 在无任务特定监督的情况下取得了强劲的性能,凸显了 VLMs 对于结构化时序理解的潜力。
引用
@article{arxiv.2602.21405,
title = {The turbulence driving mode in NGC7793 and NGC1313},
author = {Lewis J Miller and Kathryn Grasha and Christoph Federrath},
journal= {arXiv preprint arXiv:2602.21405},
year = {2026}
}
备注
18 pages, 9 figures, 3 tables, accepted for publication by MNRAS (19/02/26), results presented at Stellar Origins 2025