LLM 作为语义判官:用于无人机巡检中变压器分段的语义判定
人工智能
2026-04-08 v1
摘要
在无人机上部署轻量级分割模型进行自主变压器巡检是一个关键挑战:需要在与训练数据不同的真实世界环境中维持可靠性能。虽然紧凑的架构如 U-Net 能够实现实时 onboard 推理,但其分割输出在恶劣环境下可能会不可预测地降级,引发安全顾虑。本文研究了使用大语言模型(LLM)作为语义判官来评估 drone 安装模型产生的变压器分段结果可靠性的可行性。本文不引入新的检查系统,而是形式化一个看门人场景,即离线 LLM 对分割叠加层进行评估,并检查其在感知一致性方面是否可信赖。为此,我们设计了两种评估协议,以分析判官的重复性和灵敏度。首先,通过反复查询具有相同输入和固定提示的 LLM,衡量其质量评分和置信度估计的稳定性。其次,通过引入受控视觉腐败(雾、雨、雪、阴影和日光晕染),分析判官输出如何响应分割质量逐渐恶化的响应。我们的结果表明,LLM 在相同条件下会产生高度一致的分类判定,同时在视觉可靠性恶化时表现出适当的置信度下降。此外,判官即使在具有挑战性环境下,对感知线索(如缺失或误识别的变压器)仍然敏感。这些发现表明,在受到严格约束的情况下,LLM 可以作为可靠的语义判官,用于监控安全关键空中巡检任务中分割质量。
引用
@article{arxiv.2604.05371,
title = {LLM-as-Judge for Semantic Judging of Powerline Segmentation in UAV Inspection},
author = {Akram Hossain and Rabab Abdelfattah and Xiaofeng Wang and Kareem Abdelfatah},
journal= {arXiv preprint arXiv:2604.05371},
year = {2026}
}
备注
10 pages