中文

零样本跨语言观点目标抽取

计算与语言 2019-04-22 v1 机器学习

摘要

基于方面的情感分析涉及所谓观点目标表达式(OTEs)的识别。为自动抽取 OTEs,通常采用在有标注语料上训练的监督学习算法。这些语料的创建耗费大量人力,因此通常仅有极少数语言和领域拥有足够大的数据集。在本工作中,我们通过提出一种用于观点目标表达式抽取的零样本跨语言方法来解决特定语言缺乏可用标注数据的问题。我们利用在多种语言间共享公共向量空间的多语言词嵌入,并将其整合进用于 OTE 抽取的卷积神经网络架构中。我们以 5 种语言的实验给出了有前景的结果:我们能够在源语言的标注数据上成功训练模型,并在目标语言上准确预测,而无需使用该目标语言的任何标注样本。根据源语言与目标语言对的不同,我们在零样本设定下可达到在目标语言数据上训练模型的性能的 77%。此外,通过从多种源语言进行跨语言学习,我们可以将此性能提升至在目标语言数据上训练基线模型的 87%。

关键词

引用

@article{arxiv.1904.09122,
  title  = {Zero-Shot Cross-Lingual Opinion Target Extraction},
  author = {Soufian Jebbara and Philipp Cimiano},
  journal= {arXiv preprint arXiv:1904.09122},
  year   = {2019}
}

备注

Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies