Paxion:在视频语言基础模型中修补动作知识
计算机视觉与模式识别
2023-10-24 v4 计算与语言
摘要
动作知识涉及对动作在文本、视觉和时间方面理解。我们引入了动作动态基准(ActionBench),其包含两项精心设计的探测任务:动作反义(Action Antonym)和视频反转(Video Reversal),分别针对模型的多模态对齐能力和时间理解能力。尽管近期的视频语言模型(VidLM)在各种基准任务上表现优异,我们的诊断任务揭示了它们在动作知识上的惊人缺陷(接近随机水平),表明当前模型依赖物体识别能力作为动作理解的捷径。为此,我们提出了一种新颖的框架 Paxion,以及一种新的判别性视频动态建模(DVDM)目标。Paxion 框架利用知识修补网络(Knowledge Patcher)编码新的动作知识,并利用知识融合组件(Knowledge Fuser)将修补网络整合进冻结的 VidLM 中而不损害其已有能力。由于广泛使用的视频-文本对比(VTC)损失在学习动作知识上的局限,我们引入 DVDM 目标来训练知识修补网络。DVDM 迫使模型编码动作文本与视频帧正确排序之间的关联。我们的大量分析表明,Paxion 与 DVDM 共同有效填补了动作知识理解的缺口(从约 50% 提升至 80%),同时在广泛的以物体为中心和以动作为中心的下游任务上保持或提升了性能。代码与数据将出于研究目的在 https://github.com/MikeWangWZHL/Paxion.git 公开。
引用
@article{arxiv.2305.10683,
title = {Paxion: Patching Action Knowledge in Video-Language Foundation Models},
author = {Zhenhailong Wang and Ansel Blume and Sha Li and Genglin Liu and Jaemin Cho and Zineng Tang and Mohit Bansal and Heng Ji},
journal= {arXiv preprint arXiv:2305.10683},
year = {2023}
}
备注
NeurIPS 2023 spotlight