FORESCENE:基于潜在场景图扩散的人类活动预测
计算机视觉与模式识别
2025-03-11 v1
摘要
由于人类行为的高度可变性,预测日常活动中的人与环境交互是一项具有挑战性的任务。虽然直接从视频中进行预测是可行的,但这种方法受到混淆因素的制约,例如与交互无关的物体或背景噪声。一个有前景的替代方案是使用场景图仅追踪相关元素。然而,当前预测未来场景图的方法面临重大挑战,且通常依赖于不切实际的假设,例如物体随时间保持固定,这限制了它们在交互物体可能出现或消失的长期活动中的适用性。在本文中,我们提出了 FORESCENE,一种用于场景图预测 (SGA) 的新框架,可随时间预测物体和关系的演变。FORESCENE 使用定制的图自编码器将观测到的视频片段编码为潜在表示,并使用潜在扩散模型 (LDM) 预测未来的场景图。我们的方法能够对交互动力学进行连续预测,且不对图的内容或结构做出任何假设。我们在 Action Genome 数据集上评估了 FORESCENE,在解决显著更复杂任务的同时,其性能优于现有的 SGA 方法。
引用
@article{arxiv.2503.06182,
title = {FORESCENE: FOREcasting human activity via latent SCENE graphs diffusion},
author = {Antonio Alliegro and Francesca Pistilli and Tatiana Tommasi and Giuseppe Averta},
journal= {arXiv preprint arXiv:2503.06182},
year = {2025}
}