中文

TeleEgo:野外环境下以太 ego-centric AI 助手的基准测试

计算机视觉与模式识别 2025-12-11 v4

摘要

野外环境下的 ego-centric AI 助手必须处理多模态输入(视频、音频、文本),实时作出响应,并保持不断演变的长期记忆。然而,现有基准测试通常以孤立方式评估这些能力,缺乏真实的流式场景,或仅支持短期任务。我们引入 TeleEgo,一个用于在真实日常情境下评估 ego-centric AI 助手的持久时长、流式、全模态基准测试。数据集包含每个参与者每日 14 小时以上的同步 ego-centric 视频、音频和文本,覆盖四个领域:工作与学习、生活与例行程序、社交活动和户外与文化。所有数据在统一的全局时间线上对齐,并包含高质量的视觉叙述和语音转录文本,通过人工精炼。TeleEgo 定义 12 个诊断子任务,涵盖三个核心能力:记忆(回忆过去事件)、理解(解释当前情境)和跨记忆推理(关联远距离事件)。它包含 3,291 项人工验证的 QA 项目,涵盖多种问题格式(单选、二选、多选和开放式),严格在流式设置下进行评估。我们提出实时准确率(RTA)以联合捕捉正确性和响应速度在紧迫决策窗口下的表现,提出记忆持久时间(MPT)作为持续流中的长期记忆的前瞻性指标。在本文中,我们报告 RTA 结果,并发布 TeleEgo 及其 MPT 评估框架,作为具备更强流式记忆能力、可扩展的野外 ego-centric 助手基准测试,系统性地研究实时行为和长期视野记忆。

关键词

引用

@article{arxiv.2510.23981,
  title  = {TeleEgo: Benchmarking Egocentric AI Assistants in the Wild},
  author = {Jiaqi Yan and Ruilong Ren and Jingren Liu and Shuning Xu and Ling Wang and Yiheng Wang and Xinlin Zhong and Yun Wang and Long Zhang and Xiangyu Chen and Changzhi Sun and Jixiang Luo and Dell Zhang and Hao Sun and Chi Zhang and Xuelong Li},
  journal= {arXiv preprint arXiv:2510.23981},
  year   = {2025}
}