稀疏视频文本变换器用于本体视觉:SViTT-Ego
计算机视觉与模式识别
2024-06-17 v1 人工智能
摘要
本体视觉语言模型的预训练对于提高下游本体视频文本任务性能至关重要。这些本体基础模型通常采用变换器架构,其预训练过程中的内存占用可能相当大。因此,我们预训练了首个集成边缘稀疏和节点稀疏的稀疏本体视频文本变换器模型 SViTT-Ego。在 EgoClip 数据集上进行预训练,并采用本体友好的目标 EgoNCE(取代常用的 InfoNCE)。最突出的是,SViTT-Ego 在 EgoMCQ(帧内视频)准确率上比 LAVILA 大模型提升了 +2.8%,仅使用标准图像增强技术,即可在内存受限的设备上进行预训练。
引用
@article{arxiv.2406.09462,
title = {SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video},
author = {Hector A. Valdez and Kyle Min and Subarna Tripathi},
journal= {arXiv preprint arXiv:2406.09462},
year = {2024}
}