中文

基于 Quora 问题对数据集的自然语言理解

计算与语言 2019-07-03 v1 机器学习

摘要

本文通过考察 Quora 数据集中的重复问题检测来探索自然语言理解(NLU)任务。我们对数据集进行了广泛探索,并使用了多种机器学习模型,包括线性和基于树的模型。我们的最终发现是,一个简单的连续词袋神经网络模型具有最佳性能,胜过了更复杂的循环和基于注意力的模型。我们还进行了错误分析,发现数据集的标注中存在一定主观性。

关键词

引用

@article{arxiv.1907.01041,
  title  = {Natural Language Understanding with the Quora Question Pairs Dataset},
  author = {Lakshay Sharma and Laura Graesser and Nikita Nangia and Utku Evci},
  journal= {arXiv preprint arXiv:1907.01041},
  year   = {2019}
}