READ:用于低资源视频-语言建模中参数高效迁移学习的具有部分视频-语言对齐的循环适配器
计算机视觉与模式识别
2026-05-13 v3 计算与语言
摘要
完全微调预训练的大规模 transformer 模型已成为视频-语言建模任务(如时序语言定位和视频-语言摘要)的流行范式。随着任务数量的增加和训练数据的有限,这种完全微调方法导致昂贵的模型存储和不稳定的训练。为了克服这些缺点,我们将轻量级适配器引入预训练模型,并仅在微调时更新它们。然而,现有的适配器无法捕获视频帧或文本词之间固有的时序关系。此外,它们忽略了从原始视频-语言输入流入适配器低维空间的关键任务相关信息的保留。为了解决这些问题,我们首先提出了一种新颖的循环适配器 (READ),它采用循环计算来启用时间建模能力。其次,我们通过使用部分最优传输提出了部分视频-语言对齐 (PVLA) 目标,以维护流入我们 READ 模块的任务相关信息。我们通过大量实验验证了我们的 READ 框架,其中 READ 在多个低资源时序语言定位和视频-语言摘要基准上显著优于所有现有的微调策略。代码、模型和数据已在 https://nguyentthong.github.io/READ 上公开提供。
引用
@article{arxiv.2312.06950,
title = {READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling},
author = {Thong Nguyen and Xiaobao Wu and Xinshuai Dong and Khoi Le and Zhiyuan Hu and Cong-Duy Nguyen and See-Kiong Ng and Luu Anh Tuan},
journal= {arXiv preprint arXiv:2312.06950},
year = {2026}
}
备注
Accepted at AAAI 2024