GEXIA:面向可扩展多粒度视频-语言学习的粒度扩展与迭代逼近
计算机视觉与模式识别
2024-12-11 v1
摘要
在各种视频-语言学习任务中,实现多粒度数据的跨模态对齐仍然是一个挑战。我们提出了一种方法,从数据和建模两个关键角度来解决这一挑战。鉴于缺乏多粒度视频-文本预训练数据集,我们引入了一种带有集成(Integration)和压缩(Compression)操作的粒度扩展(Granularity EXpansion, GEX)方法,以扩展单粒度数据集的粒度。为了更好地建模多粒度数据,我们引入了一个迭代逼近模块(Iterative Approximation Module, IAM),该模块将多粒度视频和文本嵌入到一个统一的低维语义空间中,同时保留跨模态对齐所需的基本信息。此外,GEXIA 具有高度可扩展性,对用于对齐的视频-文本粒度数量没有限制。我们在七个基准数据集上对三类视频任务进行了评估,展示了最先进或可比的性能。值得注意的是,尽管预训练数据集仅包含短视频片段,我们的模型在涉及长视频理解的任务中表现出色。
引用
@article{arxiv.2412.07704,
title = {GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning},
author = {Yicheng Wang and Zhikang Zhang and Jue Wang and David Fan and Zhenlin Xu and Linda Liu and Xiang Hao and Vimal Bhat and Xinyu Li},
journal= {arXiv preprint arXiv:2412.07704},
year = {2024}
}