中文

用于人体运动理解与生成的多模态生成式 AI 与自回归 LLM:未来之路

计算机视觉与模式识别 2025-06-05 v1 人工智能

摘要

本文对多模态生成式人工智能和自回归大语言模型在人体运动理解与生成中的应用进行了深入综述,为新兴方法、架构及其在推进逼真且多用途运动合成方面的潜力提供了见解。本研究专门聚焦于文本和运动模态,探讨了文本描述如何指导生成复杂、类人的运动序列。本文探讨了各种生成方法,包括自回归模型、扩散模型、生成对抗网络、变分自编码器和基于 Transformer 的模型,分析了它们在运动质量、计算效率和适应性方面的优势与局限。文章重点介绍了文本条件运动生成的最新进展,其中文本输入被用于以更高精度控制和优化运动输出。LLM 的集成通过实现指令与运动之间的语义对齐,进一步增强了这些模型,提升了连贯性和上下文相关性。这项系统性综述强调了文本到运动 GenAI 和 LLM 架构在医疗保健、人形机器人、游戏、动画和辅助技术等应用中的变革潜力,同时探讨了生成高效且逼真的人体运动所面临的持续挑战。

关键词

引用

@article{arxiv.2506.03191,
  title  = {Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward},
  author = {Muhammad Islam and Tao Huang and Euijoon Ahn and Usman Naseem},
  journal= {arXiv preprint arXiv:2506.03191},
  year   = {2025}
}