EAGLE:以自我为中心的语言-视频聚合引擎
计算机视觉与模式识别
2024-09-27 v1 人工智能
摘要
以自我为中心的视频分析的快速发展,为从第一人称视角理解人类活动和意图带来了新的洞见。尽管取得了这些进展,但动作识别、程序学习和时刻检索等任务之间的碎片化,加上不一致的标注和孤立的模型开发,阻碍了对视频内容的整体解读。为此,我们引入了EAGLE(以自我为中心的语言-视频聚合引擎)模型和EAGLE-400K数据集,以提供一个统一的框架,整合各种以自我为中心的视频理解任务。EAGLE-400K是首个专为以自我为中心视频定制的大规模指令微调数据集,包含40万个多样化的样本,以增强从活动识别到程序知识学习等一系列广泛任务。此外,EAGLE作为一个强大的视频多模态大语言模型(MLLM),旨在有效捕捉空间和时间信息。另外,我们提出了一套评估指标,旨在促进对用于以自我为中心视频理解的MLLM进行全面评估。我们广泛的实验证明了EAGLE优于现有模型的卓越性能,突显了其在任务特定理解与整体视频解读之间取得平衡的能力。通过EAGLE,我们旨在为现实世界场景中的研究机会和实际应用铺平道路。
引用
@article{arxiv.2409.17523,
title = {EAGLE: Egocentric AGgregated Language-video Engine},
author = {Jing Bi and Yunlong Tang and Luchuan Song and Ali Vosoughi and Nguyen Nguyen and Chenliang Xu},
journal= {arXiv preprint arXiv:2409.17523},
year = {2024}
}
备注
Accepted by ACMMM 24