微调视觉语言模型以理解当前损伤并使用质量守卫代理进行优先级评分
计算机视觉与模式识别
2026-05-28 v1
摘要
日本的桥梁检查要求每五年进行一次强制性目视评估,然而不同工程师分配的定性损伤等级(a-e级)表现出显著的评估者间变异性——这是实现一致基础设施管理的关键障碍。资深工程师的老龄化进一步威胁着检查能力。本文提出了一种使用微调视觉语言模型(VLM)自动化桥梁损伤理解和修复优先级评分的方法。我们在多达4000对桥梁损伤图像和检查文本记录上使用QLoRA微调LLaVA-1.5-7B,然后在固定的800张图像测试集上进行评估。模型输出识别结构构件和损伤模式的自然语言描述,基于此,一个基于规则的评分引擎计算五级修复优先级指数。一项渐进式训练研究(1k/2k/3k/4k样本)揭示,2000个训练样本在仅2.9小时的训练中即可达到接近最优的验证损失;超过2000后,训练样本每翻倍,验证损失改善不超过0.2%,表现出明显的收益递减。此外,在保留测试集上的语义相似度在3000样本时达到峰值(0.6909),并在4000样本时下降(0.6739),表明质量策划的中等规模数据优于更大但更嘈杂的语料库。结合torch.compile()和批处理(batch_size=8)的推理优化实现了每张图像10.06秒——比未优化基线减少了70.2%。我们的方法有助于桥梁检查中的数据治理,减少评估者间变异性,并提供人工智能辅助分诊以增强检查流程中的专家工程师。此外,我们引入了一个两阶段质量守卫,使用微调的Swallow-8B SLM在优先级评分前拒绝低质量的VLM输出,防止来自损坏或无法识别图像的虚假评分。
引用
@article{arxiv.2605.27452,
title = {Fine-Tuning Vision-Language Models for Understanding Current Damage and Scoring Priority with Quality Guard Agent},
author = {Takato Yasuno},
journal= {arXiv preprint arXiv:2605.27452},
year = {2026}
}
备注
23 pages, 11 figures, 13 tables