LLaVA-Surg:面向结构化手术视频学习的多模态手术助手
计算机视觉与模式识别
2024-08-16 v1 人工智能
摘要
多模态大语言模型(LLM)在各领域取得了显著进展,而医学领域的研究大多集中于单模态图像。与此同时,当前通用领域的多模态视频模型仍缺乏理解和参与手术视频对话的能力。一个主要因素是手术领域缺乏数据集。在本文中,我们创建了一个新数据集Surg-QA,包含102,000个手术视频-指令对,是迄今为止同类数据中规模最大的。为了构建这样的数据集,我们提出了一种基于LLM的两阶段问答生成流水线,以结构化方式从公开可用的手术讲座视频中学习手术知识。该流水线将生成过程分解为两个阶段,显著降低了任务复杂度,使我们能够使用更经济、可本地部署的开源LLM,而非昂贵的付费LLM服务。这还降低了问答生成过程中LLM幻觉的风险,从而提升了生成数据的整体质量。我们进一步在该Surg-QA数据集上训练了LLaVA-Surg——一种能够回答手术视频开放性问题的新型视觉语言对话助手,并在零样本手术视频问答任务上进行了全面评估。结果表明,LLaVA-Surg显著优于所有先前的通用领域模型,展现出在回答手术视频开放性问题方面的卓越多模态对话能力。我们将发布我们的代码、模型和指令微调数据集。
引用
@article{arxiv.2408.07981,
title = {LLaVA-Surg: Towards Multimodal Surgical Assistant via Structured Surgical Video Learning},
author = {Jiajie Li and Garrett Skinner and Gene Yang and Brian R Quaranto and Steven D Schwaitzberg and Peter C W Kim and Jinjun Xiong},
journal= {arXiv preprint arXiv:2408.07981},
year = {2024}
}