Video-STAR:用于开放词汇动作识别的工具增强强化学习框架
计算机视觉与模式识别
2026-04-20 v2
摘要
多模态大语言模型(MLLM)在桥接视觉与文本推理方面展现出巨大潜力,但其对文本中心先验的依赖常限制其在开放词汇场景下准确区分语义相近动作的能力。为此,我们提出 Video-STAR,一种融合上下文子运动分解与工具增强型强化学习的框架,用于开放词汇动作识别(OVAR)。不同于将动作视为单一实体的先前方法,本方法创新性地将动作分解为判别性子运动,以实现精细匹配;同时动态调用特定领域工具进行跨模态交错,从而实现类别特定的推理能力并减少跨模态幻觉。此外,通过设计分层奖励机制平衡工具使用效率、子运动相关性与推理结构一致性,本方法能够自主利用外部工具优先排序子运动模式,而无需显式监督,实现从文本中心推理向视觉 grounding 推理的转变。在 HMDB-51、UCF-101、SSv2、Kinetics-400 和 Kinetics-600 数据集上的大规模评估表明,我们实现了业界最佳性能,优于现有方法在区分细粒度动作和处理跨模态幻觉方面的表现,验证了我们的优异鲁棒性和泛化能力。
引用
@article{arxiv.2510.08480,
title = {Video-STAR: Reinforcing Open-Vocabulary Action Recognition with Tools},
author = {Zhenlong Yuan and Xiangyan Qu and Chengxuan Qian and Rui Chen and Jing Tang and Lei Sun and Xiangxiang Chu and Dapeng Zhang and Yiwei Wang and Yujun Cai and Shuo Li},
journal= {arXiv preprint arXiv:2510.08480},
year = {2026}
}