中文

面向情感分析的不变表示学习:缺失的关键是数据集

机器学习 2019-07-30 v1 信息检索 机器学习

摘要

学习对干扰因子保持不变的表示在域适应、迁移学习与公平机器学习中具有极大意义。由于干扰因子纠缠于原始文本中,寻找此类表示在 NLP 任务中极具挑战性。据我们所知,一个主要问题还在于仅有少数 NLP 数据集能够评估此类因子的影响。本文中,我们引入两个泛化度量来评估模型对干扰因子的鲁棒性:目标偏置下的泛化与未知域上的泛化。我们将这些度量与一种简单的数据过滤方法相结合,以控制干扰因子对数据的影响,从而构建实验性有偏数据集。我们将该方法应用于文献中的标准数据集(Amazon 与 Yelp)。我们的工作表明,简单的文本分类基线(即评论上的情感分析)在学习评论极性时,可能受到产品 ID(视为干扰因子)的严重影响。所提方法是通用的,只要干扰变量在数据集中有标注即可应用。

关键词

引用

@article{arxiv.1907.12305,
  title  = {Learning Invariant Representations for Sentiment Analysis: The Missing Material is Datasets},
  author = {Victor Bouvier and Philippe Very and Céline Hudelot and Clément Chastagnol},
  journal= {arXiv preprint arXiv:1907.12305},
  year   = {2019}
}