MA-EgoQA:来自多个具身智能体的 egocentric 视频问答
计算机视觉与模式识别
2026-03-12 v2 人工智能
摘要
随着具身模型的强大发展,人类将在工作场所或家中与多个具身 AI 代理进行协作。为确保人类用户与多代理系统之间更好的沟通,关键在于并行解释来自代理的来自代理的信息,并为每个查询引用适当的上下文。现有挑战包括有效地压缩和传播以视频形式出现的高质量个人感官输入,并正确地聚合多个 egocentric 视频以构建系统级记忆。本文中,我们首先正式定义了理解多个长时段 egocentric 视频的新问题,这些视频是由具身代理同时收集的。为此,我们引入了 MultiAgent-EgoQA (MA-EgoQA),一个旨在系统性地评估我们场景中现有模型的基准。MA-EgoQA 提供 1700 个独特于多个 egocentric 流的问答,涵盖五个类别:社交互动、任务协调、理论心智、时序推理和环境互动。我们进一步提出了一个名为 EgoMAS 的简单基线模型,用于 MA-EgoQA,该模型利用具身代理之间的共享记忆和代理级动态检索。通过在 MA-EgoQA 上对多样化的基线和 EgoMAS进行全面评估,我们发现当前方法无法有效处理多个 egocentric 流,这凸显了在代理之间进行系统级理解方面的未来进步的需要。代码和基准可在 https://ma-egoqa.github.io 获取。
关键词
引用
@article{arxiv.2603.09827,
title = {MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents},
author = {Kangsan Kim and Yanlai Yang and Suji Kim and Woongyeong Yeo and Youngwan Lee and Mengye Ren and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2603.09827},
year = {2026}
}
备注
Under review