中文

ReGenNet:迈向人类动作-反应合成

计算机视觉与模式识别 2024-03-19 v1 人工智能

摘要

人类不断与其周围环境进行交互。当前以人为中心的生成模型主要关注合成与静态场景和物体合理交互的人类,而对于普遍存在的因果性人-人交互的动态人类动作-反应合成则较少被探索。人-人交互可以被视为在原子交互周期中由动作发出者和反应者组成的不对称过程。在本文中,我们全面分析了人-人交互的不对称、动态、同步和细节特性,并提出了首个多设定人类动作-反应合成基准,以在给定人类动作的条件下生成人类反应。首先,我们提出对 NTU120、InterHuman 和 Chi3D 数据集的交互序列标注动作发出者-反应者顺序。基于此,我们提出了一种基于扩散的生成模型 ReGenNet,该模型采用 Transformer 解码器架构,并结合显式的基于距离的交互损失,以在线方式预测人类反应,其中反应者无法获取动作发出者的未来状态。定量和定性结果表明,与基线方法相比,我们的方法能够生成即时且合理的人类反应,并且能够泛化到未见过的动作发出者运动和视角变化。

关键词

引用

@article{arxiv.2403.11882,
  title  = {ReGenNet: Towards Human Action-Reaction Synthesis},
  author = {Liang Xu and Yizhou Zhou and Yichao Yan and Xin Jin and Wenhan Zhu and Fengyun Rao and Xiaokang Yang and Wenjun Zeng},
  journal= {arXiv preprint arXiv:2403.11882},
  year   = {2024}
}

备注

Accepted by CVPR 2024, Project Page: https://liangxuy.github.io/ReGenNet/