基于视觉语言模型与领域特定微调的建筑代码表格理解
计算与语言
2025-11-25 v1
摘要
建筑代码包含确保安全、合规以及在建筑和工程中做出明智决策的关键信息。自动问答系统处理此类代码可实现快速准确的访问特定法规条款,从而提高效率并减少错误。检索增强生成(RAG)系统对于此任务至关重要,因为它们将信息检索的精确性与语言模型的生成能力相结合。然而,表格数据的提取具有挑战性,因为它们常涉及复杂的布局、合并单元格、多行标题以及嵌入的语义关系,这些特征难以被传统的自然语言处理技术和视觉语言模型(VLMs)轻松捕获。本文探索并比较了从建筑代码中的表格数据中提取信息的两种方法。首先,使用直接输入方法,将页面图像直接输入到VLMs中,然后让它们基于图像回答问题。其次,介绍了一种间接输入方法,即将包含表格的页面图像转换为LaTeX代码,然后基于LaTeX格式的输入来回答问题。实验发现,直接输入方法通常比间接输入方法的结果更准确。为进一步提高性能,我们对每种VLMs使用低秩适应(LoRA)在特定领域的表格数据集上进行微调。经微调的模型表现显著提升,以Qwen2.5-VL-3B-Instruct为例,准确率提升超过100%。我们的结果凸显了参数高效微调方法为适应专业领域中复杂结构数据(如建筑法规解释和合规性检查)具有巨大潜力。
引用
@article{arxiv.2511.18306,
title = {Table Comprehension in Building Codes using Vision Language Models and Domain-Specific Fine-Tuning},
author = {Mohammad Aqib and Mohd Hamza and Ying Hei Chui and Qipei Mei},
journal= {arXiv preprint arXiv:2511.18306},
year = {2025}
}