TokenHSI:基于任务分词的统一物理人体-场景交互合成
计算机视觉与模式识别
2025-04-04 v2
摘要
合成多样且物理上可行的人体-场景交互(Human-Scene Interactions, HSI)对于计算机动画和具身人工智能都至关重要。尽管已有研究取得了鼓舞人心的进展,当前方法主要专注于开发针对特定交互任务的独立控制器,这显著限制了解决需要整合多项技能的复杂HSI任务(例如边坐下边携带物体)的能力。为此,我们提出 TokenHSI,一个单一的、基于Transformer的统一策略,具备多技能统一和灵活适应能力。关键思想是将人体本体感知建模为独立的共享标记,并通过掩码机制将其与 distinct 任务标记结合。这种统一策略实现了跨技能的有效知识共享,从而促进了多任务训练。此外,我们的策略架构支持可变长度输入,使所学技能能够灵活适应新情境。通过训练额外的任务标记器,我们不仅可以修改交互目标的几何形状,还能协调多项技能以解决复杂任务。实验结果表明,我们的方法在 various HSI 任务中显著提升了灵活性、适应性和可扩展性。网站:https://liangpan99.github.io/TokenHSI/
引用
@article{arxiv.2503.19901,
title = {TokenHSI: Unified Synthesis of Physical Human-Scene Interactions through Task Tokenization},
author = {Liang Pan and Zeshi Yang and Zhiyang Dou and Wenjia Wang and Buzhen Huang and Bo Dai and Taku Komura and Jingbo Wang},
journal= {arXiv preprint arXiv:2503.19901},
year = {2025}
}
备注
CVPR 2025