中文

基于大语言模型的时间视觉语义引导的人类运动理解

机器学习 2025-12-30 v1 计算机视觉与模式识别

摘要

无监督的人类运动分割(HMS)可通过子空间聚类技术有效实现。然而,传统方法忽略了HMS中时间语义探索的作用。本文探索了从人类运动序列中派生的时间视觉语义(TVS),利用大语言模型(LLM)的图像到文本能力,以增强子空间聚类性能。核心思想是通过LLM从连续帧中提取文本运动信息,并将其纳入子空间聚类框架。主要挑战在于使用LLM从人类运动序列中学习TVS并将其整合到子空间聚类中。为此,我们通过查询LLM确定连续帧是否呈现相同运动,从而基于其响应学习时间邻域信息。随后,我们开发了集成TVS的方法,采用带时间正则化器的子空间嵌入,使每个帧与其时间邻居共享相似的子空间嵌入。此外,基于子空间嵌入并带时间约束的分割方法,使每个帧与其时间邻居进行分组。我们还引入了一个具有反馈机制的框架,持续优化基于分割输出的子空间嵌入。实验结果表明,所提方法在四个基准人类运动数据集上优于现有最先进方法。

关键词

引用

@article{arxiv.2512.22249,
  title  = {Temporal Visual Semantics-Induced Human Motion Understanding with Large Language Models},
  author = {Zheng Xing and Weibing Zhao},
  journal= {arXiv preprint arXiv:2512.22249},
  year   = {2025}
}