ViMoNet:一个基于运动与视频理解人类行为的多模态视觉-语言框架
计算机视觉与模式识别
2026-01-08 v3
摘要
本研究探讨了如何利用大语言模型(LLM)通过联合利用运动和视频数据来理解人类行为。我们认为,整合这些互补模态对于捕捉人类动作的精细运动动态和上下文语义至关重要,从而解决先前纯运动或纯视频方法的局限性。为此,我们提出了ViMoNet,这是一个通过两阶段对齐和指令微调策略训练的多模态视觉-语言框架,该策略结合了精确的运动-文本监督和大规模的视频-文本数据。我们进一步引入了VIMOS,一个包含人体运动序列、视频和指令级标注的多模态数据集,以及ViMoNet-Bench,一个用于评估以行为为中心的推理的标准化基准。实验结果表明,ViMoNet在字幕生成、运动理解和人类行为解释等任务上持续优于现有方法。该框架在辅助医疗应用中显示出巨大潜力,例如老年人监测、跌倒检测以及老龄化人口健康风险的早期识别。这项工作通过赋能可访问的AI驱动工具,促进全民健康覆盖、减少可预防的健康问题并提升整体福祉,为联合国可持续发展目标3(SDG 3:良好健康与福祉)做出了贡献。
引用
@article{arxiv.2508.09818,
title = {ViMoNet: A Multimodal Vision-Language Framework for Human Behavior Understanding from Motion and Video},
author = {Rajan Das Gupta and Lei Wei and Md Yeasin Rahat and Nafiz Fahad and Abir Ahmed and Liew Tze Hui},
journal= {arXiv preprint arXiv:2508.09818},
year = {2026}
}
备注
This is the preprint version of the manuscript. It is currently being prepared for submission to an academic conference