中文

有生于无:基于无词训练的开词汇文本到动作生成

计算机视觉与模式识别 2023-03-27 v3 人工智能

摘要

文本到动作生成是一个新兴且具有挑战性的问题,旨在合成与输入文本语义相同的动作。然而,由于缺乏多样化的标注训练数据,大多数方法要么局限于特定类型的文本标注,要么需要在推理时进行在线优化以适应文本,牺牲了效率与稳定性。本文以零样本学习的方式研究离线开词汇文本到动作生成,既不需要配对训练数据,也不需要额外的在线优化来适应未见文本。受NLP中提示学习的启发,我们预训练了一个动作生成器,学习从被掩码的动作中重建完整动作。在推理时,我们的方法不改变动作生成器,而是将输入文本重新表述为掩码动作,作为动作生成器的提示来“重建”动作。在构建提示时,提示中未掩码的姿势由文本到姿势生成器合成。为监督文本到姿势生成器的优化,我们提出了首个文本-姿势对齐模型,用于度量文本与3D姿势之间的对齐程度。为防止姿势生成器对有限训练文本过拟合,我们进一步提出了一种新颖的无词训练机制,可在无任何训练文本的情况下优化文本到姿势生成器。综合实验结果表明,我们的方法相较基线方法取得了显著改进。代码见 https://github.com/junfanlin/oohmg。

关键词

引用

@article{arxiv.2210.15929,
  title  = {Being Comes from Not-being: Open-vocabulary Text-to-Motion Generation with Wordless Training},
  author = {Junfan Lin and Jianlong Chang and Lingbo Liu and Guanbin Li and Liang Lin and Qi Tian and Chang Wen Chen},
  journal= {arXiv preprint arXiv:2210.15929},
  year   = {2023}
}