中文

PairAug:增强图像-文本对能为放射学做什么?

计算机视觉与模式识别 2024-04-09 v1

摘要

当前的视觉-语言预训练(VLP)方法主要依赖于成对的图像-文本数据集,由于隐私考虑和标注复杂性,这种资源在放射学中难以获取。数据增强提供了一种克服数据稀缺问题的实用解决方案,然而,大多数增强方法的关注点有限,仅优先考虑图像或文本的单独增强。认识到这一局限性,我们的目标是设计一个能够同时增强医学图像和文本数据的框架。我们设计了一种成对增强(PairAug)方法,包含患者间增强(InterAug)分支和患者内增强(IntraAug)分支。具体而言,该方法的 InterAug 分支利用从大型语言模型(LLM)生成的合成但合理的报告来生成放射学图像。生成的图像对可以被视为一组新的患者病例,因为它们是人工创建的,可能不存在于原始数据集中。相比之下,IntraAug 分支使用新生成的报告来处理图像。这一过程使我们能够为每位具有不同医疗状况的个体创建新的配对数据。我们在涵盖医学图像分类零样本和微调分析的各种下游任务上进行了广泛实验,结果表明我们的 PairAug 同时扩展图像和文本数据,显著优于仅图像/仅文本扩展基线和先进的医学 VLP 基线。我们的代码已在 \url{https://github.com/YtongXie/PairAug} 发布。

关键词

引用

@article{arxiv.2404.04960,
  title  = {PairAug: What Can Augmented Image-Text Pairs Do for Radiology?},
  author = {Yutong Xie and Qi Chen and Sinuo Wang and Minh-Son To and Iris Lee and Ee Win Khoo and Kerolos Hendy and Daniel Koh and Yong Xia and Qi Wu},
  journal= {arXiv preprint arXiv:2404.04960},
  year   = {2024}
}

备注

Accepted to CVPR2024