中文

面向工业GenAI平台的制药长视频推理的视觉语言模型缩放

计算机视觉与模式识别 2026-01-09 v1 机器学习

摘要

视觉语言模型(VLM)在多模态推理任务上表现出色,但大多数评估聚焦于短视频,并假设计算资源不受限。在制药内容理解等工业场景中,从业者必须在严格的GPU、延迟和成本约束下处理长视频,而许多现有方法在此情况下无法扩展。在这项工作中,我们提出了一个工业级GenAI框架,处理超过20万份PDF、8种格式(如MP4、M4V等)的25326个视频以及20多种语言的888个多语言音频文件。我们的研究有三项贡献:(i)面向制药领域多模态推理的工业级大规模架构;(ii)在两个领先基准(Video-MME和MMBench)以及涵盖14个疾病领域的25326个视频专有数据集上,对超过40个VLM进行实证分析;(iii)与长视频推理相关的四个发现:多模态的作用、注意力机制的权衡、时间推理的局限性以及GPU约束下视频分割的挑战。结果表明,在商用GPU上使用SDPA注意力可实现3-8倍的效率提升,多模态改进了多达8/12个任务领域(尤其是长度依赖型任务),并且开源和闭源VLM在时间对齐和关键帧检测方面存在明显瓶颈。本文并非提出一个新的“A+B”模型,而是刻画了当前VLM在现实部署约束下的实际限制、权衡和失败模式,并为设计工业领域长视频理解可扩展多模态系统的研究人员和从业者提供了可操作的指导。

关键词

引用

@article{arxiv.2601.04891,
  title  = {Scaling Vision Language Models for Pharmaceutical Long Form Video Reasoning on Industrial GenAI Platform},
  author = {Suyash Mishra and Qiang Li and Srikanth Patil and Satyanarayan Pati and Baddu Narendra},
  journal= {arXiv preprint arXiv:2601.04891},
  year   = {2026}
}

备注

Submitted to the Industry Track of Top Tier Conference; currently under peer review