GHOST:基于开放词汇场景与文本语境的 grounding 人类动作生成
计算机视觉与模式识别
2024-05-30 v1
摘要
我们3D环境与其描述性语言之间的联系对于在语境中定位和生成人类动作非常适合,但存在一个问题。多模态引入的复杂性使得用固定的描述符捕获这一联系具有挑战性。 Specifically,要求从头开始学习文本-场景关联的封闭词汇场景编码器在文献中受到青睐,常导致运动定位不准确。本文提出了一种方法,将开放词汇场景编码器集成到体系结构中,建立文本与场景之间的稳健连接。我们的两步方法首先通过知识蒸馏自现有开放词汇语义图像分割模型进行场景编码器预训练,确保共享的文本-场景特征空间。随后,场景编码器针对条件动作生成进行微调,包含两个新的正则化损失,对目标对象的类别和大小进行回归。我们的 методology 在HUMANISE数据集上相较于先前最先进的基线模型实现了最高30%的目标对象距离度量降低。通过三个本框架的实现以及感知研究的评估表明了这一改进。此外,我们的方法设计为能够无缝适配提供每个像素文本对齐特征的未来2D分割方法。
引用
@article{arxiv.2405.18438,
title = {GHOST: Grounded Human Motion Generation with Open Vocabulary Scene-and-Text Contexts},
author = {Zoltán Á. Milacski and Koichiro Niinuma and Ryosuke Kawamura and Fernando de la Torre and László A. Jeni},
journal= {arXiv preprint arXiv:2405.18438},
year = {2024}
}
备注
18 pages, 5 figures