中文

基于对抗强化学习的时序评分系统反经验攻击

机器学习 2023-12-20 v2 软件工程

摘要

在大数据时代,评分系统在各类平台中十分常见。从金融服务中的信用评分系统到电商购物平台的会员积分,平台管理者利用此类系统引导用户走向受鼓励的行为模式,从而更有效率和效果地管理资源。构建此类评分系统时,首先确立若干“经验准则”,随后针对每个评分因素进行专门的自上而下设计,这通常需要在新应用场景中耗费大量精力调整与调优评分函数。更糟的是,许多新项目通常缺乏真值或任何经验来评估合理的评分系统,使设计难上加难。为减少在每个新评分系统中手动调整评分函数的精力,我们创新性地从预设经验准则出发、在无任何真值情况下研究评分系统,并提出一种从零开始改进系统的新框架。本文提出一种“反经验攻击”机制,可生成“攻击”行为轨迹并尝试打破评分系统的经验规则。随后应用一个对抗式“增强器”评估评分系统并寻找改进策略。通过训练该对抗学习问题,可学到恰当的评分函数,对试图违反经验准则的攻击行为轨迹具有鲁棒性。我们在包括共享计算资源平台与金融信用系统在内的两个评分系统上进行了大量实验。实验结果验证了所提框架的有效性。

关键词

引用

@article{arxiv.2311.05144,
  title  = {Counter-Empirical Attacking based on Adversarial Reinforcement Learning for Time-Relevant Scoring System},
  author = {Xiangguo Sun and Hong Cheng and Hang Dong and Bo Qiao and Si Qin and Qingwei Lin},
  journal= {arXiv preprint arXiv:2311.05144},
  year   = {2023}
}

备注

Accepted by TKDE