用于损伤评估的量化视觉语言模型:LLaVA-1.5-7B量化水平的比较研究
计算机视觉与模式识别
2026-03-31 v1
摘要
桥梁基础设施检测是一项关键但劳动密集型的任务,需要专家评估结构损伤,如钢筋暴露、裂缝和腐蚀。本文提出了一项关于量化视觉语言模型(VLMs)用于自动化桥梁损伤评估的全面研究,重点关注描述质量、推理速度和资源需求之间的权衡。我们开发了一个端到端流水线,结合LLaVA-1.5-7B进行视觉损伤分析、结构化JSON提取和基于规则的优先级评分。为了在消费级GPU上部署,我们对三种量化水平——Q4_K_M、Q5_K_M和Q8_0——在254张钢筋暴露图像上进行了系统比较。我们引入了一个5点质量评估框架,评估损伤类型识别和严重程度分类。结果表明Q5_K_M达到了最优平衡:质量得分3.18±1.35/5.0,推理时间5.67秒/图像,质量/秒效率0.55——比Q4_K_M高8.5%的质量,仅有4.5%的速度降低,同时以25%更快的推理速度匹配Q8_0的质量。统计分析显示Q5_K_M表现出最弱的文本质量相关性(-0.148),表明其性能不受描述长度影响而保持一致。
引用
@article{arxiv.2603.26770,
title = {Quantized Vision-Language Models for Damage Assessment: A Comparative Study of LLaVA-1.5-7B Quantization Levels},
author = {Takato Yasuno},
journal= {arXiv preprint arXiv:2603.26770},
year = {2026}
}
备注
16 pages, 4 figures, 8 tables