面向真实世界事件检测的推理器:通过自适应困惑感知抽样策略扩展强化学习
机器学习
2025-07-03 v1 人工智能
摘要
在真实世界客户服务对话中检测异常事件极具挑战性,这源于商业数据的复杂性和客户交互的动态性。此外,模型必须具备强大的跨域(out-of-domain, OOD)泛化能力,以便在不同业务场景中快速适应,从而最大化商业价值。本 work 提出了一种新颖的自适应困惑感知强化学习框架(Adaptive Perplexity-Aware Reinforcement Learning, APARL),该框架利用大型语言模型的先进推理能力进行异常事件检测。APARL引入双环动态课程学习架构,使模型能够逐渐聚焦于更具挑战性的样本。该设计有效地解决了性能瓶颈,显著提升了OOD迁移能力。在食品配送对话任务上的大量评估表明,我们的模型在可适应性和鲁棒性方面实现了显著提升,在平均F1分数上提升了17.19%,在OOD迁移测试中平均提升了9.59%。该方法为异常检测模型的工业部署提供了更优解决方案,助力提升运营效率和商业收益。
引用
@article{arxiv.2507.01327,
title = {Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy},
author = {Xiaoyun Zhang and Jingqing Ruan and Xing Ma and Yawen Zhu and Jiansong Chen and Ke Zeng and Xunliang Cai},
journal= {arXiv preprint arXiv:2507.01327},
year = {2025}
}
备注
15 pages, 6 figures, submitted to EMNLP