面向大规模建筑属性制图 using 众包图像:Flickr 场景文本识别及待解决问题
计算机视觉与模式识别
2023-09-18 v1 人工智能
摘要
众包平台提供大量包含宝贵建筑信息的街景图像。本工作探讨了将场景文本识别(STR)应用于众包街景图像以进行建筑属性制图时所面临的挑战。我们使用 Flickr 图像,特别考察建筑立面上的文字。我们创建了柏林 Flickr 数据集,并使用预训练的 STR 模型进行文本检测与识别。对 STR 识别图像子集的人工核查显示出高准确率。我们检验了 STR 结果与建筑功能之间的相关性,并分析了在住宅建筑上识别出文字而在商业建筑上未识别出的实例。进一步调查揭示了该任务伴随的重大挑战,包括街景图像中文本区域小、缺乏真值标签,以及 Flickr 图像中的建筑与 OpenStreetMap(OSM)中建筑足迹的不匹配。为发展超越城市热点区域的全市域制图,我们建议区分 STR 有效适用的场景,同时开发适当算法或引入额外数据以处理其他情况。此外,应开展跨学科合作以理解建筑摄影与标注的动机。STR-on-Flickr 结果公开于 https://github.com/ya0-sun/STR-Berlin。
关键词
引用
@article{arxiv.2309.08042,
title = {Towards Large-scale Building Attribute Mapping using Crowdsourced Images: Scene Text Recognition on Flickr and Problems to be Solved},
author = {Yao Sun and Anna Kruspe and Liqiu Meng and Yifan Tian and Eike J Hoffmann and Stefan Auer and Xiao Xiang Zhu},
journal= {arXiv preprint arXiv:2309.08042},
year = {2023}
}