中文

SATO:稳定的文本到动作框架

计算机视觉与模式识别 2024-08-19 v3

摘要

文本到动作模型稳健吗?近期文本到动作模型的进展主要源于对特定动作更准确的预测。然而,文本模态通常仅依赖预训练的 Contrastive Language-Image Pretraining (CLIP) 模型。我们的研究发现了文本到动作模型的一个重要问题:其预测常常表现出不一致的输出,在面对语义相似或相同的文本输入时,会产生截然不同甚至错误的姿态。在本文中,我们进行了分析以阐明这种不稳定性的潜在原因,建立了模型输出不可预测性与文本编码器模块紊乱注意力模式之间的明确联系。因此,我们引入了一个旨在解决此问题的正式框架,将其称为稳定的文本到动作框架(SATO)。SATO 由三个模块组成,分别致力于稳定注意力、稳定预测以及在准确性与稳健性之间保持平衡。我们提出了一种构建满足注意力和预测稳定性的 SATO 的方法。为了验证模型的稳定性,我们引入了一个基于 HumanML3D 和 KIT-ML 的全新文本同义词扰动数据集。结果表明,SATO 在保持高准确率性能的同时,对同义词和其他轻微扰动具有显著更高的稳定性。

关键词

引用

@article{arxiv.2405.01461,
  title  = {SATO: Stable Text-to-Motion Framework},
  author = {Wenshuo Chen and Hongru Xiao and Erhang Zhang and Lijie Hu and Lei Wang and Mengyuan Liu and Chen Chen},
  journal= {arXiv preprint arXiv:2405.01461},
  year   = {2024}
}