Bora:面向医学领域的通用视频生成模型
计算机视觉与模式识别
2024-07-17 v2 图像与视频处理
摘要
生成模型有望 revolutionize 医学教育、机器人辅助手术以及医学AI开发的数据增强。扩散模型现在可以从文本提示生成逼真的图像,而近期进展表明其能够创建多样且高质量的视频。然而,这些模型往往难以生成医学操作和详细解剖结构的准确表征。本文介绍Bora,这是首个为文本导引的医学视频生成设计的时空扩散概率模型。Bora 利用Transformer架构,并在通用视频生成任务上进行预训练。通过建立新的医学视频语料库进行模型对齐和指令微调,该语料库包含来自various biomedical领域的配对文本-视频数据。据我们了解,这是首次建立这样一个全面的标注医学视频数据集。Bora 能够在四个不同的医学领域生成高质量视频数据,遵循医学专家标准,表现出一致性和多样性。这种通用视频生成模型在资源受限的setting中,尤其对于增强医学咨询和决策具有重要潜力。此外,Bora 可能为沉浸式医学培训和程序规划开辟道路。针对endoscopy、ultrasound、MRI和cell tracking等不同医学模态进行大量实验,验证了该模型在理解医学指令方面的有效性,并在多个 subject 上 outperform state-of-the-art generation models。
引用
@article{arxiv.2407.08944,
title = {Bora: Biomedical Generalist Video Generation Model},
author = {Weixiang Sun and Xiaocao You and Ruizhe Zheng and Zhengqing Yuan and Xiang Li and Lifang He and Quanzheng Li and Lichao Sun},
journal= {arXiv preprint arXiv:2407.08944},
year = {2024}
}