VimoRAG:基于视频的检索增强 3D 动作生成框架用于运动语言模型
计算机视觉与模式识别
2025-10-21 v2 人工智能
计算与语言
摘要
本文介绍了 VimoRAG,一种新颖的基于视频的检索增强运动生成框架,用于运动大语言模型(LLM)。随着运动 LLM 面临因标注数据有限导致的严重域外/词汇表外问题,VimoRAG 利用大规模野外视频数据库,通过检索相关 2D 人体动作信号来增强 3D 动作生成。尽管基于视频的运动 RAG 具有挑战性,我们解决了两个关键瓶颈:(1)开发有效的以运动为中心的视频检索模型,以区分人体姿态和动作,(2)缓解由次优检索结果导致的误差传播问题。我们设计了 Gemini 运动视频检索机制和运动中心双对齐 DPO 训练器,实现高效的检索和生成过程。实验结果表明,VimoRAG 显著提升了受文本输入限制的运动 LLM 的性能。所有资源均 available at https://walkermitty.github.io/VimoRAG/
引用
@article{arxiv.2508.12081,
title = {VimoRAG: Video-based Retrieval-augmented 3D Motion Generation for Motion Language Models},
author = {Haidong Xu and Guangwei Xu and Zhedong Zheng and Xiatian Zhu and Wei Ji and Xiangtai Li and Ruijie Guo and Meishan Zhang and Min zhang and Hao Fei},
journal= {arXiv preprint arXiv:2508.12081},
year = {2025}
}
备注
Accepted by NeurIPS 2025; Project Page: https://walkermitty.github.io/VimoRAG