Synth-SONAR:通过双扩散模型和GPT提示增强声纳图像合成的多样性与真实性
计算机视觉与模式识别
2024-10-14 v1 人工智能
机器学习
摘要
声纳图像合成对于推进水下勘探、海洋生物学和国防应用至关重要。传统方法通常依赖使用声纳传感器进行广泛且昂贵的数据采集,这危及数据的质量和多样性。为克服这些限制,本研究提出了一种新的声纳图像合成框架Synth-SONAR,利用扩散模型和GPT提示。Synth-SONAR的关键创新有三点:首先,通过整合基于生成式AI的风格注入技术以及真实的/模拟数据,构建了最大的声纳数据语料库之一,用于声纳研究。其次,一个双文本条件声纳扩散模型层级合成粗粒度和细粒度的声纳图像,具有增强的质量和多样性。第三,高级(粗粒度)和低级(细粒度)的基于文本的声纳生成方法利用了视觉语言模型(VLMs)和GPT提示中可用的高级语义信息。在推理时,该方法从文本描述生成多样且逼真的声纳图像,弥合了文本描述与声纳图像生成之间的鸿沟。据我们所知,这是GPT提示首次应用于声纳图像领域。Synth-SONAR在生成高质量合成声纳数据集方面达到了最先进的性能,显著增强了其多样性和真实性。
引用
@article{arxiv.2410.08612,
title = {Synth-SONAR: Sonar Image Synthesis with Enhanced Diversity and Realism via Dual Diffusion Models and GPT Prompting},
author = {Purushothaman Natarajan and Kamal Basha and Athira Nambiar},
journal= {arXiv preprint arXiv:2410.08612},
year = {2024}
}
备注
12 pages, 5 tables and 9 figures