中文

稳定的河流:文本到图像生成模型在地球科学中应用的案例研究

计算机视觉与模式识别 2023-12-14 v1 机器学习

摘要

文本到图像(TTI)生成模型可用于根据给定的文本字符串输入生成逼真的图像。这些模型在缓解地球科学领域采用机器学习所面临的挑战方面具有巨大潜力。然而,其使用的迅速增加引发了关于公平性和偏见的疑问,迄今为止的大多数研究都集中在社会和文化领域,而非特定领域的考量。我们针对地球科学进行了一项案例研究,重点关注河流地貌学领域,评估了Stable Diffusion(v1.5)在训练数据和下游模型性能中存在的特定学科偏见。除了延续西方偏见外,我们发现训练数据过度代表了风景名胜地,例如著名的河流和瀑布,并且许多环境和地貌术语存在严重的代表性不足或过度。尽管训练数据存在偏见,我们发现通过精心设计提示词,Stable Diffusion模型能够生成逼真的合成河流图像,再现许多重要的环境和地貌特征。此外,条件控制技术,例如使用带有ControlNet的条件图,对于为输出图像提供额外约束是有效的。尽管TTI模型在地球科学领域具有巨大的应用潜力,但我们主张在敏感应用中保持谨慎,并提倡对训练数据和图像生成偏见进行特定领域的审查,以减轻现有偏见的延续。

关键词

引用

@article{arxiv.2312.07833,
  title  = {Stable Rivers: A Case Study in the Application of Text-to-Image Generative Models for Earth Sciences},
  author = {C Kupferschmidt and A. D. Binns and K. L. Kupferschmidt and G. W Taylor},
  journal= {arXiv preprint arXiv:2312.07833},
  year   = {2023}
}