基于半监督知识蒸馏的改进客户交易分类
计算与语言
2021-02-16 v1 机器学习
摘要
在取送服务中,基于客户提供的自由文本进行交易分类是一个具有挑战性的问题。它涉及将种类繁多的客户输入关联到一组固定的类别,同时适应客户各异的书写风格。这种分类对企业十分重要:它有助于理解市场需求与趋势,并有助于为不同客户群体构建个性化体验。因此,以高精确率与高召回率大规模捕捉这些类别信息趋势至关重要。本文关注一个特定用例,即每笔交易由单一类别驱动。我们提出了一种基于半监督与知识蒸馏框架的高性价比交易分类方法。该方法利用客户给出的自由文本输入识别交易类别。我们使用弱标注,并注意到其性能提升与使用人工标注样本相似。在大型内部数据集与 20Newsgroup 数据集上,我们发现 RoBERTa 在分类任务中表现最佳。进一步,使用一个 ALBERT 模型(其参数量比 RoBERTa 少 33 倍),以 RoBERTa 为教师,我们观察到其性能与 RoBERTa 相近,且优于未适配的 ALBERT。该以 ALBERT 为学生、RoBERTa 为教师的框架在本文中进一步称为 R-ALBERT。该模型已投入生产,并被业务用于理解变化趋势并做出恰当决策。
引用
@article{arxiv.2102.07635,
title = {Improved Customer Transaction Classification using Semi-Supervised Knowledge Distillation},
author = {Rohan Sukumaran},
journal= {arXiv preprint arXiv:2102.07635},
year = {2021}
}
备注
8 pages, 1 figure, 7 table