中文

通过使字符串核适应测试集以改进情感分析与阿拉伯方言识别的结果

计算与语言 2018-09-03 v2

摘要

近来,字符串核在各种文本分类任务(如阿拉伯方言识别或母语识别)中取得了最先进的结果。本文中,我们应用两种简单而有效的转导学习方法以进一步改进字符串核的结果。第一种方法基于将训练集样本与测试集样本之间的成对字符串核相似度解释为特征。我们的第二种方法是一种基于两次学习迭代的简单自训练方法。在第一次迭代中,分类器按常规在训练集上训练并在测试集上测试。在第二次迭代中,一定数量的测试样本(分类器对其关联了较高置信度分数)被加入训练集进行另一轮训练。然而,所加入测试样本的 ground-truth 标签并非必要。相反,我们使用第一次训练迭代中分类器预测的标签。通过使字符串核适应测试集,我们在英语极性分类和阿拉伯方言识别中报告了显著更好的准确率。

关键词

引用

@article{arxiv.1808.08409,
  title  = {Improving the results of string kernels in sentiment analysis and Arabic dialect identification by adapting them to your test set},
  author = {Radu Tudor Ionescu and Andrei M. Butnaru},
  journal= {arXiv preprint arXiv:1808.08409},
  year   = {2018}
}

备注

Accepted at EMNLP 2018