自动场景生成:最新技术、模型、数据集、挑战与未来展望
计算机视觉与模式识别
2024-10-04 v1 人工智能
摘要
自动场景生成是一项具有机器人、娱乐、视觉表征、训练和模拟、教育等多种应用的重要研究领域。本调查综述了当前自动场景生成的最新技术,聚焦于利用机器学习、深度学习、嵌入式系统和自然语言处理(NLP)的技术。我们将模型分为四个主要类型:变分自编码器(VAEs)、生成对抗网络(GANs)、Transformer 和扩散模型。每个类别都详细探讨了各种子模型及其对该领域的贡献。我们还回顾了最常用的数据集,如 COCO-Stuff、Visual Genome 和 MS-COCO,这些数据集对于训练和评估这些模型至关重要。讨论了场景生成的方法,包括图像到3D转换、文本到3D生成、UI/布局设计、图基方法和交互式场景生成。讨论了评估指标,如FID(Fréchet Inception Distance)、KL(Kullback-Leibler)散度、IS(Inception Score)、IoU(Intersection over Union)和mAP(Mean Average Precision),并阐述了它们在评估模型性能中的应用。该调查确定了该领域的关键挑战和局限性,如保持真实性、处理包含多个对象的复杂场景以及确保对象关系和空间布局的一致性。通过总结近期进展并指出改进领域,本调查旨在为从事自动场景生成的研究人员和实践者提供宝贵资源。
引用
@article{arxiv.2410.01816,
title = {Automatic Scene Generation: State-of-the-Art Techniques, Models, Datasets, Challenges, and Future Prospects},
author = {Awal Ahmed Fime and Saifuddin Mahmud and Arpita Das and Md. Sunzidul Islam and Hong-Hoon Kim},
journal= {arXiv preprint arXiv:2410.01816},
year = {2024}
}
备注
59 pages, 16 figures, 3 tables, 36 equations, 348 references