中文

基于场景图引导的生成式 AI 框架用于综合工业危险情景

人工智能 2025-11-19 v1 计算机视觉与模式识别

摘要

训练视觉模型以准确检测工作场所危险事故,需要能够获取触发事故的不安全情景的真实图像。然而,由于捕获事故触发情景的困难,这些数据集的获取几乎不可能。为克服这一限制,本研究提出了一种新型场景图引导的生成式 AI 框架,用于综合基于美国职业安全健康管理局(OSHA)事故报告中提取的结构化危险推理,合成逼真的危险情景图像。通过 GPT-4o 分析 OSHA 描述文本,提取结构化的危险推理,并转换为捕获理解风险所必需的空间和上下文关系的对象级场景图。这些图谱指导文本到图像扩散模型生成构图准确的危险场景。为评估生成数据的真实性和语义忠实度,本文引入了视觉问答(VQA)框架。在四个最先进的生成模型中,提出的 VQA 图谱得分基于熵基准验证 outperform CLIP 和 BLIP 指标,证明其更具辨别敏感性。

关键词

引用

@article{arxiv.2511.13970,
  title  = {Scene Graph-Guided Generative AI Framework for Synthesizing and Evaluating Industrial Hazard Scenarios},
  author = {Sanjay Acharjee and Abir Khan Ratul and Diego Patino and Md Nazmus Sakib},
  journal= {arXiv preprint arXiv:2511.13970},
  year   = {2025}
}