MM-Ego:构建用于视频问答的自我中心多模态大语言模型
计算机视觉与模式识别
2025-04-15 v2 人工智能
机器学习
摘要
本研究旨在全面探索构建用于自我中心视频理解的多模态基础模型。为实现这一目标,我们从三个方面开展工作。首先,由于缺乏用于自我中心视频理解的问答数据,我们基于Ego4D中人工标注的数据,自动生成了700万个高质量的、针对时长从30秒到一小时不等的自我中心视频的问答样本。这是最大的自我中心问答数据集之一。其次,我们贡献了一个具有挑战性的自我中心问答基准,包含629个视频和7026个问题,用于评估模型在识别和记忆不同长度视频中视觉细节的能力。我们引入了一种新的去偏评估方法,以帮助减轻被评估模型中不可避免的语言偏差。第三,我们提出了一种专门的 multimodal 架构,其特点是新颖的“记忆指针提示”机制。该设计包括一个全局概览步骤,以获得对整个视频的总体理解并识别关键视觉信息,然后是一个利用关键视觉信息生成响应的回退步骤。这使得模型能够更有效地理解长视频内容。借助数据、基准和模型,我们构建了MM-Ego,一个在自我中心视频理解方面展现出强大性能的自我中心多模态大语言模型。
引用
@article{arxiv.2410.07177,
title = {MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA},
author = {Hanrong Ye and Haotian Zhang and Erik Daxberger and Lin Chen and Zongyu Lin and Yanghao Li and Bowen Zhang and Haoxuan You and Dan Xu and Zhe Gan and Jiasen Lu and Yinfei Yang},
journal= {arXiv preprint arXiv:2410.07177},
year = {2025}
}
备注
Accepted by ICLR 2025