中文

长期未来叙事生成:描述日常活动的视觉-语言模型

计算机视觉与模式识别 2025-03-04 v1

摘要

预判未来事件对于各种应用领域(如医疗保健、智能家居技术和监视)至关重要。叙事性事件描述提供上下文丰富的信息,增强了系统的未来规划和决策能力。我们提出了一个新任务:长期未来叙事生成(long-term future narration generation),它超越了传统的动作预判,生成对未来日常活动的详细叙述。我们引入了一个视觉-语言模型 ViNa,专为解决这一具有挑战性的任务而设计。ViNa 将长期视频和相应的叙述整合,以生成一系列未来叙述,预测随后事件和动作在扩展的时间范围内。ViNa 扩展了现有的多模态模型,这些模型仅执行短期预测或描述观察到的视频,通过为更广泛的日常活动生成长期未来叙述。我们还提出了一个新型下游应用,利用生成的叙述,称为未来视频检索,帮助用户通过可视化未来来提高任务计划。我们在最大的 egocentric 数据集 Ego4D 上对未来叙事生成进行了评估。

关键词

引用

@article{arxiv.2503.01416,
  title  = {Learning to Generate Long-term Future Narrations Describing Activities of Daily Living},
  author = {Ramanathan Rajendiran and Debaditya Roy and Basura Fernando},
  journal= {arXiv preprint arXiv:2503.01416},
  year   = {2025}
}