中文

局部视觉语言模型能否提升视觉Transformer的动作识别能力?——以新生儿复苏为例

计算机视觉与模式识别 2026-02-13 v1

摘要

新生儿复苏的准确记录对于质量改进和遵循临床指南至关重要,但在实践中仍未得到充分利用。先前使用3D-CNN和Vision Transformer (ViT) 的研究在从新生儿复苏视频中检测关键动作方面显示出有希望的结果,但也凸显了识别此类细粒度动作的挑战。本研究探讨了生成式AI (GenAI) 方法在改进此类视频动作识别方面的潜力。具体而言,我们探索了使用局部视觉语言模型 (VLM) 结合大语言模型 (LLM),并将其与有监督的TimeSFormer基线进行比较。使用包含13.26小时新生儿复苏视频的模拟数据集,我们评估了几种基于VLM的零样本策略以及带有分类头的微调VLM,包括低秩自适应 (LoRA)。我们的结果表明,小型(局部)VLM存在幻觉问题,但当使用LoRA进行微调时,结果达到0.91的F1分数,超过了TimeSformer的0.70结果。

关键词

引用

@article{arxiv.2602.12002,
  title  = {Can Local Vision-Language Models improve Activity Recognition over Vision Transformers? -- Case Study on Newborn Resuscitation},
  author = {Enrico Guerriero and Kjersti Engan and Øyvind Meinich-Bache},
  journal= {arXiv preprint arXiv:2602.12002},
  year   = {2026}
}

备注

Presented at the Satellite Workshop on Workshop 15: Generative AI for World Simulations and Communications & Celebrating 40 Years of Excellence in Education: Honoring Professor Aggelos Katsaggelos, IEEE International Conference on Image Processing (ICIP), 2025