中文

在类别数庞大领域中使用RNN的快速最近邻分类

信息检索 2017-12-12 v1

摘要

在涉及文本分类且类别数庞大(数以万计)、每类训练样本少且往往冗长的场景中,最近邻方法有效,但与每一类的训练样本计算相似度得分非常缓慢。另一方面,机器学习模型在运行时速度快,但利用每类少量可用训练样本充分训练它们并不可行。本文提出一种混合方法,级联1)快速但精度较低的循环神经网络(RNN)模型与2)缓慢但精度较高、使用句法特征词袋的最近邻模型。使用级联方法,我们在来自IT支持服务的数据集上进行了实验,该数据集需将客户投诉文本分类以返回前NN个可能错误码,结果表明慢速系统的查询时间缩减至原来的1/61/6,同时其精度得到提升。我们的方法在查询时间缩减上优于基于LSH的基线。我们还推导了级联模型精度关于各独立模型精度的下界。在任何两阶段方法中,选择正确的候选数量传递给第二阶段至关重要。我们证明了一个有助于为级联系统选择该截断数的结论。

关键词

引用

@article{arxiv.1712.03941,
  title  = {Fast Nearest-Neighbor Classification using RNN in Domains with Large Number of Classes},
  author = {Gautam Singh and Gargi Dasgupta and Yu Deng},
  journal= {arXiv preprint arXiv:1712.03941},
  year   = {2017}
}

备注

12 Pages, 2 Theorems, 6 Figures, 1 Algorithm