中文

SafeMo: 以语言学方式实现可信文本到动作生成的无学习方法

计算机视觉与模式识别 2026-01-05 v1

摘要

基于扩散模型的文本到动作(T2M)生成方法在现实感和对齐性方面取得了显著成果。近年来,人们对T2M方法的安全性提出了日益严峻的质疑;现有方法通过替换离散VAE码本条目来引导模型远离不安全行为。然而,基于离散码本替换的方法存在两个关键缺陷:其一,替换被良性提示词复用的码本条目会导致日常任务出现偏差,降低模型的良性性能;其二,基于离散token的方法引入量化和平滑损失,导致产生 artifacts 及僵硬的运动过渡。此外,现有的文本到动作数据集天然包含不安全意图及相应动作,难以用于安全导向的机器学习。为此,我们提出SafeMo——一种集成最小运动无学习(Minimal Motion Unlearning, MMU)的可信运动生成框架,实现连续空间中的安全人体动作生成,无需码本损失地保持连续运动学,实现当前基线方法与之相比的显著安全-实用性权衡。此外,我们首次构建了SafeMoVAE-29K数据集,集成重写后的安全文本提示与连续精细化运动,支持可信人体运动无学习。基于DiP框架,SafeMo能够高效生成具有自然过渡的安全人体动作。实验表明,SafeMo在有效执行无学习任务方面表现出色,通过强化对不安全提示词的遗忘,分别比当前最先进的人体运动无学习方法LCR在HumanML3D和Motion-X上分别提高了2.5倍和14.4倍的忘却集合FID分数,同时在处理安全提示词时,良性性能更佳或相当。代码:https://github.com/AIGeeksGroup/SafeMo。网站:https://aigeeksgroup.github.io/SafeMo。

关键词

引用

@article{arxiv.2601.00590,
  title  = {SafeMo: Linguistically Grounded Unlearning for Trustworthy Text-to-Motion Generation},
  author = {Yiling Wang and Zeyu Zhang and Yiran Wang and Hao Tang},
  journal= {arXiv preprint arXiv:2601.00590},
  year   = {2026}
}