中文

ChEmREF:评估语言模型在化学紧急响应中的就绪状态

人工智能 2025-11-18 v2

摘要

应急救援人员在处理危险物质 HAZMAT 事故时,面临关键且时效性极强的决策,需手动浏览大量化学指南。我们探讨了现代语言模型是否能够通过快速可靠地理解关键信息、识别危险源并提供建议,从而帮助应急人员。我们介绍了化学紧急响应评估框架(Chemical Emergency Response Evaluation Framework, ChEmREF),这是一个新的基准测试,包含来自应急响应指南手册和 PubChem 数据库的 1,035 种 HAZMAT 化学品问题。ChEmREF 包含三个任务:(1)化学表示形式之间的翻译(结构化与非结构化形式之间,如将 C2H6O 转换为乙醇);(2)紧急响应生成(如推荐合适的撤退距离);(3)来自化学安全和认证考试的领域知识问答。我们评估的最佳模型在非结构化 HAZMAT 化学表示翻译上的准确率为 68.0%,在事件响应建议上的 LLM Judge 分数为 52.7%,在 HAMZAT 考试上的多选准确率为 63.9%。这些发现表明,尽管语言模型在 various 任务中展现出帮助应急人员的潜力,但由于其当前局限性,仍需谨慎的人工监督。

关键词

引用

@article{arxiv.2511.10027,
  title  = {ChEmREF: Evaluating Language Model Readiness for Chemical Emergency Response},
  author = {Risha Surana and Qinyuan Ye and Swabha Swayamdipta},
  journal= {arXiv preprint arXiv:2511.10027},
  year   = {2025}
}