思考后反应:面向无约束的人类动作-反应生成
人机交互
2025-03-24 v1 人工智能
机器人学
摘要
建模人类动作-反应生成在诸如人机交互和游戏等实际应用中具有重要意义。尽管近期在单个人动作生成方面取得了进展,但在动作-反应生成任务中仍面临挑战,这源于直接在没有提示的情况下预测反应动作的困难,以及缺乏有效编码多人动作的统一表示。为此,我们引入Think-Then-React(TTR),一个基于大语言模型的框架,用于生成人类式的反应。首先,通过我们的细粒度多模态训练策略,TTR能够在推理期统一两个过程:一个思考过程,通过显式推断动作意图和原因来推导相应的反应描述,这些作为语义提示;以及一个反应过程,基于输入动作和推断的语义提示进行反应预测。其次,为了有效地在语言模型中表示多人动作,我们提出了一种统一的动作标记器,通过解耦自身中心姿态和绝对空间特征,有效地以相同编码表示动作和反应动作。广泛的实验表明,TTR在现有基线上取得显著改进,在评估指标上实现了显著提升,例如将FID从3.988降低到1.942。
引用
@article{arxiv.2503.16451,
title = {Think-Then-React: Towards Unconstrained Human Action-to-Reaction Generation},
author = {Wenhui Tan and Boyuan Li and Chuhao Jin and Wenbing Huang and Xiting Wang and Ruihua Song},
journal= {arXiv preprint arXiv:2503.16451},
year = {2025}
}
备注
Accepted by ICLR 2025