中文

MoTE:在视觉语言到视频知识传递中实现泛化与专业化的统一

计算机视觉与模式识别 2024-10-15 v1

摘要

将来自大规模视频识别基础模型的视觉语言知识传递已被证明有效。为弥合领域差距,需添加额外参数模块以捕获时序信息。然而,随着专用参数数量的增加,零样本泛化能力会下降,现有方法在零样本与封闭集性能之间呈权衡。本文提出MoTE,一个新型框架,使泛化与专业化能在一个统一模型中平衡。我们的 метод通过调节时序专家的混合,学习具有不同数据拟合程度的多个任务视图。为最大程度保留每个专家的知识,我们提出了权重空间正则化,以正则化专家在权重空间中的合并过程。此外,结合时序特征调制以正则化测试期间的时序特征贡献。我们在零样本和封闭集视频识别任务之间取得了良好平衡,并在包括Kinetics-400与600、UCF和HMDB等多个数据集上取得最先进或有竞争力的结果。代码可在\url{https://github.com/ZMHH-H/MoTE}获取。

关键词

引用

@article{arxiv.2410.10589,
  title  = {MoTE: Reconciling Generalization with Specialization for Visual-Language to Video Knowledge Transfer},
  author = {Minghao Zhu and Zhengpu Wang and Mengxian Hu and Ronghao Dang and Xiao Lin and Xun Zhou and Chengju Liu and Qijun Chen},
  journal= {arXiv preprint arXiv:2410.10589},
  year   = {2024}
}

备注

NeurIPS 2024 Camera Ready