中文

基于距离的来源域选择用于情感分类

信息检索 2018-08-29 v1 机器学习 机器学习

摘要

近年来,对短文本片段的自动情感分类(SC)受到越来越多关注。由于源域与目标域中情感表达不同,在未见域上以极少或无误标样本执行SC会显著影响分类性能。在本研究中,我们旨在通过提出一种基于预测度量的方法来缓解这一不良影响,该度量允许我们从一组候选域中选择最优源域。所提度量是源域与目标域上概率分布之间已知距离函数(如推土机距离与Kullback-Leibler散度)的线性组合。所提方法的性能通过一个SC案例研究验证,其中我们的数值实验表明,在朴素与自适应学习设置下,与随机选定源域相比跨域分类误差均有显著改善。对于更异构的数据集,所提模型的可预测特征可用于进一步选择候选域子集,相应分类器优于在所有可用源域上训练的分类器。该观察强化了一个假设:我们的模型也可用作SC训练阶段过滤冗余信息的手段。

关键词

引用

@article{arxiv.1808.09271,
  title  = {Distance Based Source Domain Selection for Sentiment Classification},
  author = {Lex Razoux Schultz and Marco Loog and Peyman Mohajerin Esfahani},
  journal= {arXiv preprint arXiv:1808.09271},
  year   = {2018}
}