面向平面图解读的知识驱动描述合成
计算机视觉与模式识别
2026-02-20 v1
摘要
图像描述生成是 AI 领域中一个广为人知的问题。从平面图图像生成描述在室内路径规划、房地产和提供建筑解决方案等方面有应用。文献中已探索了多种从平面图图像生成描述或半结构化描述的方法。由于仅生成描述不足以捕捉细粒度细节,研究人员还提出了从图像生成描述性段落。然而,这些描述结构僵硬且缺乏灵活性,难以在实时场景中使用。本文提出了两种模型——基于图像线索的描述合成(DSIC)和基于 Transformer 的描述生成(TBDG),用于平面图图像到文本的生成,以填补现有方法的不足。这两种模型利用现代深度神经网络进行视觉特征提取和文本生成。两模型的区别在于它们从平面图图像获取输入的方式。DSIC 模型仅采用由深度神经网络自动提取的视觉特征,而 TBDG 模型从输入平面图图像中学习提取出的带有段落的文本描述。TBDG 中生成的具体关键词并结合段落理解,使其在通用平面图图像上更鲁棒。实验在大规模公开数据集上进行,并与最先进的技术进行比较,以展示所提模型的优越性。
引用
@article{arxiv.2103.08298,
title = {Knowledge driven Description Synthesis for Floor Plan Interpretation},
author = {Shreya Goyal and Chiranjoy Chattopadhyay and Gaurav Bhatnagar},
journal= {arXiv preprint arXiv:2103.08298},
year = {2026}
}
备注
19 pages, 18 Figure