从潘帕斯草原到像素:微调扩散模型用于高乔文化遗产
计算机视觉与模式识别
2025-07-08 v1 人工智能
计算与语言
摘要
生成式AI已在社会中无处不在,在各个领域见证了显著进展。特别是在文本到图像(TTI)模型领域,潜在扩散模型(LDM)展示了基于文本提示生成视觉内容的卓越能力。本文探讨了LDM在表现地方文化概念、历史人物和濒危物种方面的潜力。本研究以巴西南里奥格兰德州(RS)的文化遗产作为说明性案例。我们的目标是促进对生成模型如何帮助捕捉和保存地区文化与历史身份的广泛理解。本文概述了方法论,包括主题选择、数据集创建和微调过程。结果展示了生成的图像,以及每个概念的挑战和可行性。总之,这项工作展示了这些模型在表现和保存不同地区和社区独特方面的能力。
引用
@article{arxiv.2401.05520,
title = {From Pampas to Pixels: Fine-Tuning Diffusion Models for Ga\'ucho Heritage},
author = {Marcellus Amadeus and William Alberto Cruz Castañeda and André Felipe Zanella and Felipe Rodrigues Perche Mahlow},
journal= {arXiv preprint arXiv:2401.05520},
year = {2025}
}