中文

胎儿发育自动描述的多模态AI模型:InVitroVision

人工智能 2026-04-24 v1

摘要

人工智能(AI)在体外受精(IVF)中的应用显示出改善决策一致性和标准化的潜力,但通常依赖标注数据且未充分利用IVF数据的多模态特性。我们调查了基础视觉语言模型能否微调以预测胎儿形态和发育的自然语言描述。使用公开的胎儿时间序列数据集,我们微调了PaliGemma-2,这是一个多模态视觉语言模型,只需1,000张图像和对应的描述性文字,描述了胎儿形态、胚胎细胞周期和发育阶段。我们的结果表明,微调后的模型InVitroVision在整体指标上优于商业模型ChatGPT 5.2以及基础模型,随着训练数据集的增大,性能不断提升。这一研究表明,基础视觉语言模型能够在有限数据下泛化到IVF任务,从而预测胎儿形态和发育的自然语言描述。这种方法可能促进大型语言模型检索相关出版物和指南中的信息和科学证据,并在IVF的多项下游任务中实现零样本适应。

关键词

引用

@article{arxiv.2604.21061,
  title  = {InVitroVision: a Multi-Modal AI Model for Automated Description of Embryo Development using Natural Language},
  author = {Nicklas Neu and Thomas Ebner and Jasmin Primus and Raphael Zefferer and Bernhard Schenkenfelder and Mathias Brunbauer and Florian Kromp},
  journal= {arXiv preprint arXiv:2604.21061},
  year   = {2026}
}

备注

15 pages, 2 figures