EgoCross:面向跨域 egocentric 视频问答的多模态大语言模型基准
计算机视觉与模式识别
2026-03-11 v2 人工智能
摘要
近期多模态大语言模型(MLLMs)的进展显著推动了以场始视频问答(EgocentricQA)的前沿。然而,现有基准和研究主要局限于烹饪、清洁等常见日常活动。相比之下,实际部署不可避免地会遇到领域迁移,即目标领域在视觉风格和语义内容上与原领域差异显著。为弥合这一差距,我们引入 EgoCross,一套全面基准,旨在评估 MLLMs 在 EgocentricQA 中的跨域泛化能力。EgoCross 涵盖四个具有挑战性的领域:外科手术、工业生产、极限运动和动物视角,代表了真实且高影响力的应用场景。其包含约 1000 对 QA 配对,跨 798 个视频片段,涵盖四个关键 QA 任务:预测、识别、定位和计数。每对 QA 配对提供 OpenQA 与 CloseQA 两种格式,以支持细粒度评估。广泛实验表明,大多数现有 MLLMs,无论是通用型还是以场始专业化,都难以在日常生活之外的领域实现泛化,凸显了当前模型的局限性。进一步,我们开展了若干探索性研究,如微调和强化学习,以探讨潜在改进方法。我们期望 EgoCross 及其随附分析将为推动具备领域适应性和鲁健性的场始视频理解提供基础。
引用
@article{arxiv.2508.10729,
title = {EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering},
author = {Yanjun Li and Yuqian Fu and Tianwen Qian and Qi'ao Xu and Silong Dai and Danda Pani Paudel and Luc Van Gool and Xiaoling Wang},
journal= {arXiv preprint arXiv:2508.10729},
year = {2026}
}