面向自主实验室安全监控的视觉语言模型:通过场景结构学习识别危险
计算机视觉与模式识别
2026-02-03 v1 机器学习
摘要
实验室容易因小的不安全行为导致严重伤害,但持续的安全监控——超出强制性实验前安全培训——受限于人力 availability。视觉语言模型(VLM)为自主实验室安全监控提供了希望,但其在真实场景中的效果尚不明了,这主要是由于缺乏视觉评估数据,因为大多数安全事件仅以非结构化文本形式记录。为弥补这一差距,我们首先引入一种结构化数据生成管道,将文本实验场景转换为aligned的三元组(图像、场景图、ground truth),其中大语言模型充当场景图建构者,图像生成模型充当渲染器。我们的实验在由1,207个样本(涵盖362个独特场景)和七个开放及封闭源模型组成的合成数据集上表明,VLM在给定文本场景图时表现有效,但在视觉-only设置下性能显著下降,表明从像素中直接提取结构化对象关系的难度较大。为克服这一问题,我们提出一种后训练context工程方法——场景图引导对齐(scene-graph-guided alignment)——通过将视觉输入转换为更符合VLM推理的结构化场景图来弥补VLM之间的感知差距,提高了视觉-only设置下危险检测的性能。
引用
@article{arxiv.2602.00414,
title = {Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure},
author = {Trishna Chakraborty and Udita Ghosh and Aldair Ernesto Gongora and Ruben Glatt and Yue Dong and Jiachen Li and Amit K. Roy-Chowdhury and Chengyu Song},
journal= {arXiv preprint arXiv:2602.00414},
year = {2026}
}