使用自动标注数据集的B-LSTM与CRF无监督方面术语抽取
计算与语言
2017-09-18 v1
摘要
方面术语抽取(ATE)识别文本中带有观点的方面术语,是SemEval基于方面的情感分析(ABSA)评测中的任务之一。可用于监督ATE的数据集数量稀少,且方面术语的人工标注成本高昂,这催生了对无监督ATE的需求。本文中,我们引入了一种在监督ATE任务上取得顶尖排名性能的架构。此外,它还可作为无监督ATE的特征提取器与分类器高效使用。我们的第二项贡献是一种自动构建ATE数据集的方法。我们在自动标注的数据集上训练分类器,并在人工标注的SemEval ABSA测试集上进行评估。与强基于规则的基线相比,我们获得了大幅更高的F值,并达到超过80%的精确率。我们的无监督方法击败了SemEval的监督ABSA基线,同时保持了高精确率分数。
引用
@article{arxiv.1709.05094,
title = {Unsupervised Aspect Term Extraction with B-LSTM & CRF using Automatically Labelled Datasets},
author = {Athanasios Giannakopoulos and Claudiu Musat and Andreea Hossmann and Michael Baeriswyl},
journal= {arXiv preprint arXiv:1709.05094},
year = {2017}
}
备注
9 pages, 3 figures, 2 tables 8th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA), EMNLP 2017