PINO:面向任意规模群体的长时与可定制运动生成的人物交互噪声优化
计算机视觉与模式识别
2025-07-28 v1
摘要
生成涉及多个角色的逼真群体交互仍然具有挑战性,因为随着群体规模扩大,复杂性也随之增加。现有的条件扩散模型通过基于先前生成的角色进行条件化来逐步生成运动,但它们依赖于单一的共享提示,限制了精细控制,并导致交互过于简化。在本文中,我们提出了人物交互噪声优化(PINO),这是一种新颖的、无需训练的框架,旨在为任意规模的群体生成逼真且可定制的交互。PINO 将复杂的群体交互分解为语义相关的成对交互,并利用预训练的双人交互扩散模型逐步组合群体交互。为确保物理合理性并避免角色之间的重叠或穿透等常见伪影,PINO 在噪声优化过程中采用了基于物理的惩罚项。这种方法允许用户在不进行额外训练的情况下,精确控制角色的朝向、速度和空间关系。全面的评估表明,PINO 能够生成视觉逼真、物理一致且适应性强的多人交互,适用于各种动画、游戏和机器人应用。
引用
@article{arxiv.2507.19292,
title = {PINO: Person-Interaction Noise Optimization for Long-Duration and Customizable Motion Generation of Arbitrary-Sized Groups},
author = {Sakuya Ota and Qing Yu and Kent Fujiwara and Satoshi Ikehata and Ikuro Sato},
journal= {arXiv preprint arXiv:2507.19292},
year = {2025}
}
备注
Accepted to ICCV 2025, Project page: https://sinc865.github.io/pino/