LifeEval:面向日常生活任务的多模态辅助 AI 基准
人工智能
2026-03-03 v1
摘要
多模态大语言模型(MLLM)的快速进步标志着通用人工智能的一个重要步骤,为增强人类能力提供了巨大潜力。然而,它们在动态现实环境中提供有效帮助的能力仍然受到很大关注。现有的视频基准主要评估被动理解,通过回顾性分析或孤立的感知任务,无法捕捉实时用户帮助的交互式和自适应性。为弥合这一差距,我们介绍LifeEval,一个设计用于评估从第一人称视角进行日常生活中人机协作的实时、任务导向的人机交互的多模态基准。LifeEval 强调三个关键方面:任务导向的整体评估、来自连续第一人称流的 egocentric 实时感知,以及通过自然对话的人机协作交互。通过严格的标注流程构建,基准包含4,075对高质量问答对,覆盖6个核心能力维度。对26个最先进MLLM在LifeEval上的广泛评估揭示了在实现及时、有效和自适应交互方面存在重大挑战,凸显了推进以人类为中心的交互智能的关键方向。
引用
@article{arxiv.2603.00490,
title = {LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks},
author = {Hengjian Gao and Kaiwei Zhang and Shibo Wang and Mingjie Chen and Qihang Cao and Xianfeng Wang and Yucheng Zhu and Xiongkuo Min and Wei Sun and Dandan Zhu and Guangtao Zhai},
journal= {arXiv preprint arXiv:2603.00490},
year = {2026}
}