从理解到参与:基于视觉语言模型(VLMs)的个性化制药视频片段生成
计算机视觉与模式识别
2026-01-09 v1 机器学习
摘要
视觉语言模型(VLMs)有望通过实现智能、可扩展且自动化的多模态内容处理,引领制药行业的数字化转型。传统的异构数据模态(文本、图像、视频、音频和网络链接)人工标注容易出现不一致、质量下降以及内容利用效率低下的问题。长视频和音频数据的庞大体量进一步加剧了这些挑战(例如漫长的临床试验访谈和教育研讨会)。在此,我们引入了一种领域自适应的视频到视频片段生成框架,该框架集成了音频语言模型(ALMs)和视觉语言模型(VLMs)以生成精彩片段。我们的贡献包括三个方面: 可复现的 Cut & Merge 算法,具备淡入/淡出和时间戳归一化功能,确保平滑过渡和音视频对齐; 基于角色定义和提示注入的个性化机制,用于生成定制化输出(营销、培训、监管); 平衡 ALM/VLM 增强处理的成本高效的端到端流水线策略。在 Video MME 基准(900)以及我们包含跨越 14 个疾病领域的 16,159 个制药视频的专有数据集上的评估表明,该方法实现了 3 到 4 倍的加速、4 倍的成本降低以及具竞争力的片段质量。除了效率提升外,我们还报告了我们的方法相较于最先进 VLM 基线(例如 Gemini 2.5 Pro)提升了片段连贯性得分(0.348)和信息量得分(0.721),突显了面向生命科学的透明、定制化抽取且支持合规的视频摘要的潜力。
引用
@article{arxiv.2601.05059,
title = {From Understanding to Engagement: Personalized pharmacy Video Clips via Vision Language Models (VLMs)},
author = {Suyash Mishra and Qiang Li and Srikanth Patil and Anubhav Girdhar},
journal= {arXiv preprint arXiv:2601.05059},
year = {2026}
}
备注
Contributed original research to top tier conference in VLM; currently undergoing peer review