中文

预训练文本嵌入模型在建筑资产信息对齐中的基准测试

计算与语言 2024-11-20 v1 人工智能 信息检索 机器学习

摘要

将建筑资产信息准确映射到既定的数据分类系统和分类法中,对于有效的资产管理至关重要,无论是在项目交接时的合规性检查还是临时数据集成场景中。由于建筑资产数据的复杂性(主要由技术文本元素构成),这一过程在很大程度上仍依赖人工并需要领域专家的投入。上下文文本表示学习(文本嵌入)的最新突破,特别是通过预训练大语言模型,为促进建筑资产数据交叉映射的自动化提供了有前景的方法。然而,目前尚未进行全面的评估来衡量这些模型有效表示建筑资产技术术语特有复杂语义的能力。本研究对最先进的文本嵌入模型进行了比较基准测试,以评估它们在将建筑资产信息与特定领域技术概念对齐方面的有效性。我们提出的数据集源自两部著名的建筑资产数据分类词典。我们在六个提出的数据集上进行了基准测试,涵盖聚类、检索和重排序三项任务,结果突出了未来研究在领域适应技术方面的需求。基准测试资源已作为开源库发布,并将进行维护和扩展以支持该领域的未来评估。

关键词

引用

@article{arxiv.2411.12056,
  title  = {Benchmarking pre-trained text embedding models in aligning built asset information},
  author = {Mehrzad Shahinmoghadam and Ali Motamedi},
  journal= {arXiv preprint arXiv:2411.12056},
  year   = {2024}
}