Bisecle: 基于记忆结合与分离的视频语言持续学习
计算机视觉与模式识别
2025-07-02 v1 机器学习
摘要
前沿视觉语言模型(VLM)在视频理解任务上取得了显著进展。然而,现实世界的视频通常以持续演化的数据流形式存在(例如,由佩戴式眼镜捕获的动态场景), necessitating models 能够持续适应变化的数据分布和新情景。鉴于在新任务上对模型进行微调的计算成本高昂,通常只会更新模型的子集参数而保持大部分参数冻结。这在大型多模态基础模型的持续学习语境下提出了新的挑战,即灾难性遗忘和更新冲突。尽管基础模型在参数高效持续学习方面困难重重,人类大脑的海马体却演化出了高度高效的记忆形成与巩固机制。灵感来自海马体中快速的结合(Binding)与模式分离(pattern separation)机制,本文提出Bisecle用于视频语言持续学习,该方法引入多向监督模块以捕获更多跨模态关系,并设计对比式提示学习方案以隔离任务特定知识,促进高效记忆存储。结合与分离过程进一步增强VLM保留复杂经验的能力,使其在视频理解任务中实现稳健且高效的持续学习。我们对所提出的Bisecle进行了全面评估,证明其在多个VideoQA基准测试中有效缓解遗忘并提升跨任务泛化能力。
引用
@article{arxiv.2507.00469,
title = {Bisecle: Binding and Separation in Continual Learning for Video Language Understanding},
author = {Yue Tan and Xiaoqian Hu and Hao Xue and Celso De Melo and Flora D. Salim},
journal= {arXiv preprint arXiv:2507.00469},
year = {2025}
}
备注
23 pages, 12 figures, 10 tables