改进航空安全分析:使用基于组相对策略优化的强化学习自动 HFACS 分类
计算与语言
2025-09-01 v1 人工智能
摘要
分析航空事故背后的人类因素对于预防未来事件至关重要,但传统方法使用人类因素分析和分类系统(HFACS)受限于可扩展性和一致性。为解决此问题,我们引入了一个用于航空安全分析的自动 HFACS 分类框架,该框架利用基于组相对策略优化(GRPO)的强化学习来微调 Llama-3.1 8B 语言模型。我们的方法针对航空安全分析整合了多组件奖励系统,并集成了合成数据生成以克服事故数据集中的类别不平衡问题。得到的 GRPO 优化模型实现了显著的性能提升,包括精确匹配准确率从 0.0400 提升至 0.1800(增幅 350%),以及部分匹配准确率提升至 0.8800。显著的是,我们的专用模型在关键指标上超过了最先进的大语言模型(LLM),包括 GPT-5-mini 和 Gemini-2.5-flash。该研究还提出了在多标签 HFACS 分类问题中使用精确匹配准确率作为评估语言模型高级推理能力的新基准方法。最终,我们的工作验证了较小的、针对领域优化的模型可以提供计算上更高效且更好的解决方案,以满足关键安全分析的需求。这种方法使得在资源受限的边缘设备上部署强大且低延迟的模型成为可能。
引用
@article{arxiv.2508.21201,
title = {Improving Aviation Safety Analysis: Automated HFACS Classification Using Reinforcement Learning with Group Relative Policy Optimization},
author = {Arash Ahmadi and Sarah Sharif and Yaser Banad},
journal= {arXiv preprint arXiv:2508.21201},
year = {2025}
}