VISTA:面向日常助理的生成式环视视频框架
计算与语言
2026-05-12 v1
摘要
训练AI智能体以主动协助人类完成日常活动(从例行家务到紧急安全情境),需要大规模的视觉数据。然而,在现实世界中捕获此类情境往往困难、昂贵或不安全,且基于物理的模拟器缺乏足够的视觉保真度,难以将学习到的行为迁移到真实环境。因此,我们引入VISTA,一个视频合成系统,生成用于AI智能体训练和评估的高保真度环视视频。VISTA采用5步脚本生成流程,结合因果逆向推理,创建多样且逻辑严谨的干预模式。这些情境分为两个代理自主性水平:反应式和主动式。在反应式模式中,用户明确请求代理帮助。在主动式模式中,代理会在未收到直接请求的情况下主动提供帮助。我们进一步将主动式模式分为显式和隐式两类。在显式主动情境中,用户意识到需要帮助但未直接向代理表述。在隐式主动情境中,代理会在用户意识到需要帮助之前进行介入。VISTA允许用户自定义和细化情境,以生成日常任务的视频基准,为训练和评估AI智能体在真实环境中的行为提供可扩展且可控的替代方案。
引用
@article{arxiv.2605.10579,
title = {VISTA: A Generative Egocentric Video Framework for Daily Assistance},
author = {Yu-Hsiang Liu and Yu-Chien Tang and An-Zi Yen},
journal= {arXiv preprint arXiv:2605.10579},
year = {2026}
}
备注
pre-print