REVECA——面向视频事件描述器的富编码器-解码器框架
计算机视觉与模式识别
2022-06-22 v1 人工智能
摘要
我们描述了在 CVPR 2022 长视频理解研讨会举办的通用边界事件描述挑战赛中使用的一种方法。我们设计了一个面向视频事件描述器的富编码器-解码器框架(REVECA),该框架利用视频中的空间和时间信息为相应的事件边界生成描述。REVECA 使用帧位置嵌入来整合事件边界前后的信息。此外,它采用通过时间分段网络和时间基成对差分方法提取的特征来学习时间信息。采用语义分割掩码进行注意力池化过程,以学习事件的主体。最后,应用 LoRA 对图像编码器进行微调,以提高学习效率。REVECA 在 Kinetics-GEBC 测试数据上取得了 50.97 的平均分,比基线方法提高了 10.17。我们的代码可在 https://github.com/TooTouch/REVECA 获取。
引用
@article{arxiv.2206.09178,
title = {REVECA -- Rich Encoder-decoder framework for Video Event CAptioner},
author = {Jaehyuk Heo and YongGi Jeong and Sunwoo Kim and Jaehee Kim and Pilsung Kang},
journal= {arXiv preprint arXiv:2206.09178},
year = {2022}
}
备注
The IEEE/CVF Computer Vision and Pattern Recognition Conference (CVPR). LOng-form VidEo Understanding (LOVEU) workshop