中文

HMVLM:基于 MoE LoRA 的人类动作-视觉-语言模型

计算机视觉与模式识别 2025-11-04 v1 人工智能 图形学

摘要

指令调优数据的扩展使基础语言模型能够在 diverse downstream 任务中展现出更好的指令遵循能力和优异性能。语义丰富的 3D 人体动作正逐渐被集成到这些基础模型中,以增强多模态理解和跨模态生成能力。然而,人体动作与文本之间的模态差距引发了关于在集成过程中发生灾难性遗忘的 unresolved concerns。此外,开发兼容自回归的姿态表示方式,以保持对异构 downstream 任务的通用性仍是关键技术瓶颈。为此,我们提出Human Motion-Vision-Language Model (HMVLM),一种基于 Mixture of Expert Low-Rank Adaption (MoE LoRA) 策略的统一框架。该框架利用门控网络根据输入提示动态分配 LoRA expert 权重,实现多个任务的同步微调。为缓解指令调优期间的灾难性遗忘,我们引入一种 novel zero expert 以保留通用语言任务的预训练参数。对于姿态表示,我们通过将人体划分为不同关节组来实现 body-part-specific tokenization,从而增强表示的空间分辨率。实验表明,我们的方法有效缓解了指令调优期间的知识遗忘,在 diverse 人体动作 downstream 任务中实现了卓越的性能。

关键词

引用

@article{arxiv.2511.01463,
  title  = {HMVLM: Human Motion-Vision-Lanuage Model via MoE LoRA},
  author = {Lei Hu and Yongjing Ye and Shihong Xia},
  journal= {arXiv preprint arXiv:2511.01463},
  year   = {2025}
}

备注

10 pages, 5figures. The Thirty-Ninth Annual Conference on Neural Information Processing Systems