OST:以最优时空描述符精炼文本知识用于通用视频识别
计算机视觉与模式识别
2024-03-29 v2
摘要
由于在大规模视频数据上训练视觉-语言模型资源密集,多数研究集中于将预训练图像-语言模型适配到视频域。主流流程提出以额外时间学习器解决视觉差异,却忽略了网络规模描述性叙述与简洁动作类别名间的显著差异,导致语义空间区分度低与潜在性能局限。本文中,我们优先精炼文本知识以促进可泛化视频识别。为解决类别名语义空间区分度低的局限,我们提示大语言模型(LLM)将动作类名增强为时空描述符,从而弥合文本差异并作为通用识别的知识库。此外,为对不同视频实例分配最佳描述符,我们提出最优描述符求解器,将视频识别问题建模为跨帧级表示与描述符的最优匹配流求解。在零样本、少样本与全监督视频识别上的综合评估凸显了方法的有效性。我们的最佳模型在 Kinetics-600 上取得 75.1% 的零样本准确率,达到最先进水平。
引用
@article{arxiv.2312.00096,
title = {OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video Recognition},
author = {Tongjia Chen and Hongshan Yu and Zhengeng Yang and Zechuan Li and Wei Sun and Chen Chen},
journal= {arXiv preprint arXiv:2312.00096},
year = {2024}
}
备注
Technical report. Project Page: https://tomchen-ctj.github.io/OST/