从非结构化建筑技术规格中提取结构化需求以用于建筑信息模型
计算与语言
2025-08-20 v1 人工智能
摘要
本研究探索了将建筑信息模型(Building Information Modeling, BIM)与自然语言处理(Natural Language Processing, NLP)集成,以自动从建筑行业中非结构化的法语建筑技术规格(Building Technical Specification, BTS)文档中提取需求。该研究采用命名实体识别(Named Entity Recognition, NER)和关系抽取(Relation Extraction, RE)技术,利用基于转换器的模型 CamemBERT,并应用使用法语模型 Fr_core_news_lg 进行迁移学习,后者在大型法语语料库中预训练。为对benchmark这些模型,本研究开发了从基于规则到深度学习的方法。对于 RE,实现了四种监督式模型,包括随机森林(Random Forest),并使用自定义特征向量。使用手工标注的数据集比较了 NER 方法和 RE 模型的有效性。结果表明,CamemBERT 和 Fr_core_news_lg 在 NER 中表现优异,F1 分数超过 90%,而随机森林在 RE 中最为有效,F1 分数超过 80%。旨在表示为知识图谱,以进一步增强自动验证系统。
引用
@article{arxiv.2508.13833,
title = {Extracting Structured Requirements from Unstructured Building Technical Specifications for Building Information Modeling},
author = {Insaf Nahri and Romain Pinquié and Philippe Véron and Nicolas Bus and Mathieu Thorel},
journal= {arXiv preprint arXiv:2508.13833},
year = {2025}
}