中文

FantasyHSI:基于图的智能体框架实现任意场景中以视频生成为中心的4D人体合成

计算机视觉与模式识别 2025-09-03 v1

摘要

人-场景交互(HSI)旨在复杂环境中生成逼真的人类行为,但在处理长时序、高层级任务以及泛化至未见场景方面面临重大挑战。为解决这些局限性,我们提出了 FantasyHSI,一种以视频生成和多智能体系统为中心且无需成对数据的新型 HSI 框架。我们将复杂的交互过程建模为动态有向图,并在此基础上构建协作多智能体系统。该系统包含用于环境感知和高层级路径规划的场景导航智能体,以及将长时序目标分解为原子动作的规划智能体。关键在于,我们引入了一个评论家智能体,通过评估生成动作与规划路径之间的偏差来建立闭环反馈机制。这使得动态校正由生成模型的随机性引起的轨迹漂移成为可能,从而确保长期的逻辑一致性。为了增强生成动作的物理真实感,我们利用直接偏好优化(DPO)训练动作生成器,显著减少了肢体扭曲和脚部滑动等伪影。在我们定制的 SceneBench 基准上的大量实验表明,FantasyHSI 在泛化性、长时序任务完成度和物理真实感方面显著优于现有方法。项目页面:https://fantasy-amap.github.io/fantasy-hsi/

关键词

引用

@article{arxiv.2509.01232,
  title  = {FantasyHSI: Video-Generation-Centric 4D Human Synthesis In Any Scene through A Graph-based Multi-Agent Framework},
  author = {Lingzhou Mu and Qiang Wang and Fan Jiang and Mengchao Wang and Yaqi Fan and Mu Xu and Kai Zhang},
  journal= {arXiv preprint arXiv:2509.01232},
  year   = {2025}
}

备注

https://fantasy-amap.github.io/fantasy-hsi/