AvatarGO:零样子人-物体交互生成与动画
计算机视觉与模式识别
2024-10-10 v1
摘要
近期扩散模型的进展显著提升了4D全身人体-物体交互(HOI)的生成与动画能力。然而,现有方法主要聚焦于SMPL基的运动生成,因真实大规模交互数据的稀缺而受限,影响其创建日常HOI场景的能力。本文采用零样方法,利用预训练扩散模型来实现目标。尽管存在这种潜力,实现目标仍具挑战性,因为扩散模型缺乏对“物体与之交互的‘位置’”和“交互的‘方式’”的理解。为此,我们引入AvatarGO框架,直接从文本输入生成可动画化的4D HOI场景。具体而言,1)针对“where”问题,我们提出LLM引导的接触定向技术,利用Lang-SAM从文本提示中识别接触身体部位,确保人体-物体空间关系的精准表征。2)针对“how”问题,我们引入基于SMPL-X的线性混合皮肤函数的对应感知运动优化,构建人体和物体模型的运动场。我们的框架不仅生成连贯的构件运动,还在处理穿透问题方面表现出更大的鲁棒性。广泛的实验验证了AvatarGO在多种人体-物体组合和多样姿态下的卓越生成与动画能力。作为首个合成带有物体交互的4D头像的方法,我们希望AvatarGO能为人类中心4D内容创新开启新可能。
引用
@article{arxiv.2410.07164,
title = {AvatarGO: Zero-shot 4D Human-Object Interaction Generation and Animation},
author = {Yukang Cao and Liang Pan and Kai Han and Kwan-Yee K. Wong and Ziwei Liu},
journal= {arXiv preprint arXiv:2410.07164},
year = {2024}
}
备注
Project page: https://yukangcao.github.io/AvatarGO/