基于链式证据的少样本多模态推理时序动作定位
计算机视觉与模式识别
2025-12-29 v5 人工智能
摘要
传统时序动作定位(TAL)方法依赖大量详细标注数据,而少样本TAL通过仅使用少量训练样本即可识别未见动作类别,减少了对标注数据的依赖。然而,现有少样本TAL方法通常仅关注视频级信息,忽略了文本信息,这些信息为动作定位任务提供了宝贵的语义支持。为此,本文提出一种新的少样本时序动作定位方法——链式证据多模态推理(Chain-of-Evidence Multimodal Reasoning),以提升定位性能。具体而言,我们设计了一种新型的少样本学习框架,包含语义感知文本-视觉对齐模块,用于在不同层次上对齐查询视频和支撑视频。同时,为更好地表达文本层次上动作之间的时序依赖性和因果关系,我们设计了链式证据(CoE)推理方法,引导视觉语言模型(VLM)和大语言模型(LLM)为视频生成CoE文本描述。生成的文本能够捕捉比视觉特征更丰富的动作变体。我们在公开的ActivityNet1.3、THUMOS14以及我们新收集的Human-related Anomaly Localization Dataset上进行了大规模实验。实验结果表明,我们的方法在单实例和多实例场景中均显著优于现有方法。我们的源代码和数据已公开于https://github.com/MICLAB-BUPT/VAL-VLM。
引用
@article{arxiv.2504.13460,
title = {Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization},
author = {Mengshi Qi and Hongwei Ji and Wulian Yun and Xianlin Zhang and Huadong Ma},
journal= {arXiv preprint arXiv:2504.13460},
year = {2025}
}