中文

填充-场景:面向人类视频生成的功能感知

计算机视觉与模式识别 2025-07-02 v1

摘要

视频生成模型能否被改造为交互式世界模拟器?我们通过教导模型预测人类-环境相互作用来探索文本到视频模型的功能感知潜力。给定场景图像和描述人类动作的提示,我们微调模型以插入人物,同时确保行为连贯性、外观一致性、场景融合以及场景功能感知。与先前工作不同,本文从单张场景图像推断人类功能感知(即插入人物位置及其行为方式),无需明确条件如边界框或身体姿态。深入研究跨注意力热图,表明我们能够在无标注功能感知数据集的情况下揭示预训练视频模型固有的功能感知能力。

关键词

引用

@article{arxiv.2507.00334,
  title  = {Populate-A-Scene: Affordance-Aware Human Video Generation},
  author = {Mengyi Shan and Zecheng He and Haoyu Ma and Felix Juefei-Xu and Peizhao Zhang and Tingbo Hou and Ching-Yao Chuang},
  journal= {arXiv preprint arXiv:2507.00334},
  year   = {2025}
}

备注

Project page: https://shanmy.github.io/Populate-A-Scene