Q-Adapter:用于从视频字幕中提取文本相关特征的视觉查询适配器
计算机视觉与模式识别
2025-10-14 v1
摘要
视频字幕的最新进展由大规模预训练模型推动,其遵循标准的“预训练后微调”范式,对下游任务进行完整模型微调。虽然有效,但随着模型规模的增加,这种方法变得计算上不可行。参数高效微调 (PEFT) 方法为这一替代方案提供了前景,但主要关注多模态大语言模型 (MLLM) 的语言组件。尽管近期取得了进展,PEFT 在多模态任务中仍未得到充分探索,且在模型微调期间缺乏对视觉信息的充分理解。为弥合这一差距,我们提出 Query-Adapter (Q-Adapter),一种轻量级视觉适配器模块,旨在通过增强 MLLM 的能力,为视频字幕任务提供高效微调。Q-Adapter 引入可学习的查询标记和门控层到视觉编码器中,使其能够在不依赖外部文本监督的情况下,有效提取稀疏且与字幕相关的特征。我们在两个著名的视频字幕数据集 MSR-VTT 和 MSVD 上进行评估,在 BLEU@4、METEOR、ROUGE-L 和 CIDEr 指标中,Q-Adapter 在采用 PEFT 方法的基准中实现了状态最佳性能。Q-Adapter 还在仅使用 1.4% 参数的情况下,实现了与采用完整微调方法的竞争性能。我们进一步分析了关键超参数和设计选择对微调效果的影响,提供了关于基于适配器学习优化策略的见解。这些结果凸显了 Q-Adapter 在在字幕质量和参数效率之间取得平衡方面的强大潜力,展示了其在视频语言建模中的可扩展性。
引用
@article{arxiv.2510.10022,
title = {Q-Adapter: Visual Query Adapter for Extracting Textually-related Features in Video Captioning},
author = {Junan Chen and Trung Thanh Nguyen and Takahiro Komamizu and Ichiro Ide},
journal= {arXiv preprint arXiv:2510.10022},
year = {2025}
}
备注
ACM Multimedia Asia 2025