中文

从非结构化建筑技术规格中提取结构化需求以用于建筑信息模型

计算与语言 2025-08-20 v1 人工智能

摘要

本研究探索了将建筑信息模型(Building Information Modeling, BIM)与自然语言处理(Natural Language Processing, NLP)集成,以自动从建筑行业中非结构化的法语建筑技术规格(Building Technical Specification, BTS)文档中提取需求。该研究采用命名实体识别(Named Entity Recognition, NER)和关系抽取(Relation Extraction, RE)技术,利用基于转换器的模型 CamemBERT,并应用使用法语模型 Fr_core_news_lg 进行迁移学习,后者在大型法语语料库中预训练。为对benchmark这些模型,本研究开发了从基于规则到深度学习的方法。对于 RE,实现了四种监督式模型,包括随机森林(Random Forest),并使用自定义特征向量。使用手工标注的数据集比较了 NER 方法和 RE 模型的有效性。结果表明,CamemBERT 和 Fr_core_news_lg 在 NER 中表现优异,F1 分数超过 90%,而随机森林在 RE 中最为有效,F1 分数超过 80%。旨在表示为知识图谱,以进一步增强自动验证系统。

关键词

引用

@article{arxiv.2508.13833,
  title  = {Extracting Structured Requirements from Unstructured Building Technical Specifications for Building Information Modeling},
  author = {Insaf Nahri and Romain Pinquié and Philippe Véron and Nicolas Bus and Mathieu Thorel},
  journal= {arXiv preprint arXiv:2508.13833},
  year   = {2025}
}