中文

通过排序学习在无监督情况下检测细粒度跨语言语义分歧

计算与语言 2020-10-09 v1

摘要

检测不同语言所传达内容中的细粒度差异对跨语言 NLP 和多语料库分析十分重要,但这是一个具有挑战性的机器学习问题,因为标注成本高且难以扩展。本工作改进了细粒度语义分歧的预测与标注。我们引入了一种针对多语言 BERT 模型的训练策略,通过学习对具有不同粒度的合成分歧示例进行排序。我们在理性化英法语义分歧数据集(Rationalized English-French Semantic Divergences,随本工作发布的新数据集)上评估我们的模型,该数据集由带有语义分歧类别和词元级依据的英法句子对组成。学习排序比强大的句子级相似度模型更准确地检测细粒度句子级分歧,而词元级预测有潜力进一步区分粗粒度和细粒度分歧。

关键词

引用

@article{arxiv.2010.03662,
  title  = {Detecting Fine-Grained Cross-Lingual Semantic Divergences without Supervision by Learning to Rank},
  author = {Eleftheria Briakou and Marine Carpuat},
  journal= {arXiv preprint arXiv:2010.03662},
  year   = {2020}
}

备注

EMNLP 2020