中文

CountLLM:基于大语言模型的通用重复动作计数方法

计算机视觉与模式识别 2025-07-01 v2

摘要

重复动作计数旨�计数视频中周期性运动,在健身监控等视频分析应用中具有重要价值。然而,现有方法大多依赖回归网络,表征能力有限,难以准确捕捉可变周期模式。此外,基于狭窄有限训练集的监督学习导致过拟合,限制了其在多样化场景中的泛化能力。为此,我们提出CountLLM——首个基于大语言模型(LLM)的框架,输入视频数据和周期性文本提示,输出所需的计数值。CountLLM利用显式文本指令中丰富的线索以及预训练LLM的强大表征能力进行重复动作计数。为有效引导CountLLM,我们开发了基于周期性的结构化模板指令,描述周期性属性并实施标准化答案格式以确保一致性。此外,我们提出了渐进式多模态训练范式以增强LLM的周期性感知能力。广泛的基准测试表明,CountLLM在性能和泛化能力方面均表现优异,尤其擅长处理与训练数据显著偏离的新颖和超域动作,为重复动作计数提供了可前景的方案。

关键词

引用

@article{arxiv.2503.17690,
  title  = {CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model},
  author = {Ziyu Yao and Xuxin Cheng and Zhiqi Huang and Lei Li},
  journal= {arXiv preprint arXiv:2503.17690},
  year   = {2025}
}

备注

Accepted by CVPR 2025