中文

序列嵌入有助于识别医疗保险中的欺诈案例

机器学习 2019-10-09 v1 密码学与安全 机器学习

摘要

欺诈给金融与保险行业的企业和客户带来了巨大的成本与损失。例如欺诈性信用卡交易或欺诈性索赔。据估计,保险行业每年发生的损失及理赔费用中约有 1010 个百分点源于欺诈性索赔。金融与保险领域数字化的兴起与普及产生了大型数据集,尤其包含文本数据,可用于欺诈检测。本文中,我们提出通过深度学习进行文本嵌入的架构,与其他机器学习方法相比,有助于改进欺诈性索赔的检测。我们利用一家大型国际健康保险公司的数据集说明了我们的方法。实证结果表明,我们的方法优于其他最先进(state-of-the-art)方法,并有助于使索赔管理流程更高效。随着(非结构化)文本数据对经济学家和计量经济学家日益可用,我们所提出的方法将适用于许多类似应用,特别是当变量具有大量类别时——例如卫生经济学与卫生服务中典型的国际疾病分类(ICD)编码。

关键词

引用

@article{arxiv.1910.03072,
  title  = {Sequence embeddings help to identify fraudulent cases in healthcare insurance},
  author = {I. Fursov and A. Zaytsev and R. Khasyanov and M. Spindler and E. Burnaev},
  journal= {arXiv preprint arXiv:1910.03072},
  year   = {2019}
}