中文

Ego-VPA:基于参数高效适应的以人为中心视频理解

计算机视觉与模式识别 2025-02-28 v2 机器学习

摘要

视频理解通常需要在适应新领域时对大型主干网络进行微调。本文利用基于视频语言预训练的以人为中心视频基础模型(Ego-VFMs),提出一种用于以人为中心视频任务的参数高效适应方法,称为Ego-VPA。该方法为每个视频帧/文本特征采用基于基准提示的局部稀疏近似,所选基准提示用于合成视频/文本提示。由于基准提示在帧和模态之间共享,能够以高效方式建模上下文融合和跨模态迁移。实验表明,Ego-VPA在轻量级适应方面表现卓越(仅使用0.84%可学习参数),显著优于基线方法,性能接近完整微调。

关键词

引用

@article{arxiv.2407.19520,
  title  = {Ego-VPA: Egocentric Video Understanding with Parameter-efficient Adaptation},
  author = {Tz-Ying Wu and Kyle Min and Subarna Tripathi and Nuno Vasconcelos},
  journal= {arXiv preprint arXiv:2407.19520},
  year   = {2025}
}

备注

Accepted to WACV 2025