HyperTokens:控制连续视频语言理解中的 Token 动态
计算机视觉与模式识别
2026-03-17 v2 机器学习
摘要
多模态大语言模型(LLM)用于连续 VideoQA 受任务之间干扰以及存储任务特定提示器的高昂成本的制约。我们提出了 HyperTokens,一种基于 Transformer 的 token 生成器,可按需生成精细调优 token,显式控制提示更新,同时保持内存固定。为抑制遗忘,我们提出了受元学习启发的正则化器,旨在避免任务特定的尖锐方向,并将不断演化的生成器锚定到先前任务。我们进一步将目标与锐度感知优化相连接,提供洞察为何它鼓励更平坦的跨任务最小值并改进保留。除了正则化,HyperTokens 通过共享生成权重利用轻量级辅助多模态监督;基于因果视角,我们设计可行目标和代理互信息损失,以正则化反因果跨模态方向。在两个标准连续 VideoQA 基准数据集上,HyperTokens 实现更高的平均准确率并显著降低遗忘。最后,我们引入一个具有挑战性的跨模态 ImageQA->VideoQA 协议,表明 HyperTokens 在此设置下实现了稳健的连续迁移。
引用
@article{arxiv.2603.06662,
title = {HyperTokens: Controlling Token Dynamics for Continual Video-Language Understanding},
author = {Toan Nguyen and Yang Liu and Celso De Melo and Flora D. Salim},
journal= {arXiv preprint arXiv:2603.06662},
year = {2026}
}