中文

CODE-ACCORD:用于自动合规性检查的建筑法规数据语料库

信息检索 2025-02-19 v4

摘要

在建筑、工程和建造(AEC)领域实现自动合规性检查(ACC)需要自动化解释建筑法规才能发挥其全部潜力。将文本规则转化为机器可读格式面临自然语言复杂性和针对高级机器学习(ML)资源稀缺的挑战。为解决这些挑战,我们引入了 CODE-ACCORD,这是一个来自英国和芬兰建筑法规的 862 句语料数据集。仅考虑自包含句,这些句子在不需额外上下文的情况下即可表达完整规则,这些规则对于 ACC 是必需的。每句话都由由 12 名标注员手动标注实体和关系,以促进机器可读规则的生成,随后进行精心策划以确保准确性。最终数据集包含 4,297 个实体和 4,329 个关系,涵盖 various 类别,作为强大的真实基准。CODE-ACCORD 支持 various ML 和自然语言处理(NLP)任务,包括文本分类、实体识别和关系抽取。这使得能够将最近的趋势,如深度神经网络和大型语言模型,应用于 ACC。

关键词

引用

@article{arxiv.2403.02231,
  title  = {CODE-ACCORD: A Corpus of building regulatory data for rule generation towards automatic compliance checking},
  author = {Hansi Hettiarachchi and Amna Dridi and Mohamed Medhat Gaber and Pouyan Parsafard and Nicoleta Bocaneala and Katja Breitenfelder and Gonçal Costa and Maria Hedblom and Mihaela Juganaru-Mathieu and Thamer Mecharnia and Sumee Park and He Tan and Abdel-Rahman H. Tawil and Edlira Vakaj},
  journal= {arXiv preprint arXiv:2403.02231},
  year   = {2025}
}

备注

This is a preprint of an article published in the Scientific Data Journal