HERO:基于视频的人类反应生成
计算机视觉与模式识别
2025-03-12 v1
摘要
人类反应生成是交互式 AI 的一个重要研究领域,因为人类不断与其周围环境进行交互。以往的工作主要侧重于在给定人类运动序列的情况下合成反应性动作。这种范式将交互类别局限于人与人之间的交互,并忽略了可能影响反应生成的情感。在本工作中,我们提出从 RGB 视频生成 3D 人类反应,这涉及更广泛的交互类别,并自然地提供了可能反映主体情感的表情信息。为了应对这一任务,我们提出了 HERO,一个简单而强大的基于视频的人类反应生成框架。HERO 同时考虑视频的全局表示和帧级局部表示以提取交互意图,然后使用提取的交互意图来指导反应的合成。此外,局部视觉表示被持续注入模型中,以最大化利用视频固有的动态属性。此外,为了支持该任务,我们收集了包含配对视频-运动数据的 ViMo 数据集。除了人与人之间的交互外,这些视频-运动对还涵盖了人与动物以及人与场景之间的交互。大量实验证明了我们方法的优越性。代码和数据集将公开于 https://jackyu6.github.io/HERO。
引用
@article{arxiv.2503.08270,
title = {HERO: Human Reaction Generation from Videos},
author = {Chengjun Yu and Wei Zhai and Yuhang Yang and Yang Cao and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2503.08270},
year = {2025}
}