外科文本到图像生成
计算机视觉与模式识别
2025-03-24 v3
摘要
获取用于科研和开发的外科数据显著受到高标注成本和实际和伦理约束的限制。利用合成生成的图像可能提供一个有价值的替代方案。本文探索了将文本到图像生成模型适用于外科领域的方法,使用 CholecT50 数据集,该数据集提供了带有动作三元组(器械、动词、目标)标注的外科图像。我们调查了Several 种语言模型,发现 T5 在针对基于三元组的文本输入对外科动作进行区分方面提供更独特的特征,并展示了更强的长文本和三元组文本标题之间的对齐。为解决仅凭三元组文本训练文本到图像模型而没有额外输入和监督信号的挑战,我们发现三元组文本嵌入在潜在空间中是仪器中心化的。利用这一洞察,我们设计了一种基于仪器的类别平衡技术来抵消数据不平衡和偏斜,提高训练收敛性。扩展 Imagen,这是一种基于扩散的生成模型,我们开发了外科 Imagen 用于从基于三元组的文本提示生成照片级逼真且活动对齐的外科图像。我们对模型进行质量、对齐、推理和知识的评估,实现了 FID 和 CLIP 分别为 3.7 和 26.8%。人类专家调查显示,参与者对生成样本的逼真特征感到极大挑战,表明 Surgical Imagen 作为实际替代真实数据收集的有效方法。
引用
@article{arxiv.2407.09230,
title = {Surgical Text-to-Image Generation},
author = {Chinedu Innocent Nwoye and Rupak Bose and Kareem Elgohary and Lorenzo Arboit and Giorgio Carlino and Joël L. Lavanchy and Pietro Mascagni and Nicolas Padoy},
journal= {arXiv preprint arXiv:2407.09230},
year = {2025}
}
备注
13 pages, 13 figures, 3 tables, published in Pattern Recognition Letters 2025, project page at https://camma-public.github.io/endogen/