感知、对话与适配:基础模型的多模态知识迁移用于开放世界视频识别
计算机视觉与模式识别
2025-12-19 v2
摘要
开放世界视频识别具有挑战性,因为传统网络在复杂的环境变化中泛化能力不佳。相比之下,拥有丰富知识的基础模型最近展现了其泛化能力。然而,如何将此类知识应用于开放世界视频识别尚未得到充分探索。为此,我们提出了一种通用的知识迁移流程,逐步利用并整合来自基础模型的外部多模态知识,以提升开放世界视频识别性能。我们将该方法命名为 PCA,包含感知(Percept)、对话(Chat)和适配(Adapt)三个阶段。首先,我们执行感知过程以减小视频域差距并获取外部视觉知识。其次,我们在对话阶段生成丰富的语言语义作为外部文本知识。最后,我们在适配阶段通过将多模态知识适配模块插入网络来融合外部多模态知识。我们在三个具有挑战性的开放世界视频基准数据集(即 TinyVIRAT、ARID 和 QV-Pipe)上进行了大量实验。我们的方法在所有三个数据集上均取得了最先进(SOTA)的性能。
引用
@article{arxiv.2402.18951,
title = {Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition},
author = {Boyu Chen and Siran Chen and Kunchang Li and Qinglin Xu and Yu Qiao and Yali Wang},
journal= {arXiv preprint arXiv:2402.18951},
year = {2025}
}
备注
35 pages, 6 figures, 8 tables