中文

Abex-rat: synergizing abstractive data augmentation and adversarial training for occupational accident report classification

机器学习 2026-01-29 v4 信息检索

摘要

职业事故报告的自动分类是职场安全分析的关键任务,但始终受到严重的类别不平衡和数据稀缺的制约。本文提出了 ABEX-RAT 框架,融合生成式数据增强与鲁棒对抗学习,实现资源高效的分类。不同于计算昂贵的大型语言模型(LLM)微调,本方法采用两阶段抽象-扩写(ABEX)管道:首先利用引导式 LLM 将标签关键语义蒸馏为简洁摘要,再扩展为多样化合成样本以平衡数据分布。随后采用随机对抗训练(RAT)协议训练轻量级分类器,通过随机注入扰动提升泛化性而计算开销不显著。OSHA 数据集实验表明,ABEX-RAT 达到 90.32% 的宏平均F1分数,显著优于传统基线和微调大模型,证明有针对性的数据增强结合鲁棒训练是专业领域分类的优越、数据高效替代方案。源码将在接受后公开。

关键词

引用

@article{arxiv.2509.02072,
  title  = {Abex-rat: Synergizing Abstractive Augmentation and Adversarial Training for Classification of Occupational Accident Reports},
  author = {Jian Chen and Jiabao Dou},
  journal= {arXiv preprint arXiv:2509.02072},
  year   = {2026}
}