中文

基于大规模无条件下预训练的合成增强

计算机视觉与模式识别 2023-08-09 v1

摘要

基于深度学习的医学图像识别系统通常需要大量带专家标注的训练数据,而此类数据的获取昂贵且耗时。近来,已有合成增强技术被提出,通过以类别标签为条件生成逼真图像来缓解该问题。然而,这些方法的有效性严重依赖于所训练生成模型的表征能力,而在缺乏充足标注训练数据时这一点无法保证。为进一步减少对标注数据的依赖,我们提出一种称为 HistoDiffusion 的合成增强方法,其可在大规模无标注数据集上预训练,随后应用于小规模标注数据集进行增强训练。具体而言,我们在多样的无标注数据集上训练一个潜扩散模型(LDM)以学习通用特征并无条件生成逼真图像。然后,我们在一个未见过的标注数据集上通过潜空间中的分类器引导对模型微调,使其能合成特定类别的图像。此外,我们采用选择性机制,仅添加与目标标签匹配度高置信度的合成样本。我们通过在三个组织病理学数据集上预训练、并在排除于预训练数据集之外的结直肠癌(CRC)组织病理学数据集上测试来评估所提方法。借助 HistoDiffusion 增强,骨干分类器在使用少量原始标签时的分类准确率显著提升了 6.4%。我们的代码见 https://github.com/karenyyy/HistoDiffAug。

关键词

引用

@article{arxiv.2308.04020,
  title  = {Synthetic Augmentation with Large-scale Unconditional Pre-training},
  author = {Jiarong Ye and Haomiao Ni and Peng Jin and Sharon X. Huang and Yuan Xue},
  journal= {arXiv preprint arXiv:2308.04020},
  year   = {2023}
}

备注

MICCAI 2023