EgoVideo:探索以人主导视频基础模型及其下游适应
计算机视觉与模式识别
2024-07-02 v4
摘要
本报告提出了我们对EgoVis挑战赛解决方案,包括Ego4D挑战赛的五个轨道和EPIC-Kitchens挑战赛的三个轨道。基于视频-语言双塔模型,利用我们 meticulously 组织的人主导视频数据,我们引入一种新颖的基础模型,称为EgoVideo。该模型专为满足以人主导视频的独特特征而设计,为我们的竞赛提交提供强大的支持。在Ego4D挑战中,我们解决了包括自然语言查询、步骤定位、时刻查询、短期物体互动预测和长期动作预测等各种任务。此外,我们还参与了EPIC-Kitchens挑战赛,通过开展动作识别、多实例检索和动作识别域适应三个轨道。通过将EgoVideo适应于这些多样化的任务,我们展示了其在不同以人主导视频分析场景中的通用性和有效性,展示了EgoVideo作为以人主导基础模型的强大表征能力。我们的代码和预训练模型已公开发布于 https://github.com/OpenGVLab/EgoVideo。
引用
@article{arxiv.2406.18070,
title = {EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation},
author = {Baoqi Pei and Guo Chen and Jilan Xu and Yuping He and Yicheng Liu and Kanghua Pan and Yifei Huang and Yali Wang and Tong Lu and Limin Wang and Yu Qiao},
journal= {arXiv preprint arXiv:2406.18070},
year = {2024}
}
备注
Champion solutions in the EgoVis CVPR 2024 workshop