基于 Quora 问题对数据集的自然语言理解
计算与语言
2019-07-03 v1 机器学习
摘要
本文通过考察 Quora 数据集中的重复问题检测来探索自然语言理解(NLU)任务。我们对数据集进行了广泛探索,并使用了多种机器学习模型,包括线性和基于树的模型。我们的最终发现是,一个简单的连续词袋神经网络模型具有最佳性能,胜过了更复杂的循环和基于注意力的模型。我们还进行了错误分析,发现数据集的标注中存在一定主观性。
引用
@article{arxiv.1907.01041,
title = {Natural Language Understanding with the Quora Question Pairs Dataset},
author = {Lakshay Sharma and Laura Graesser and Nikita Nangia and Utku Evci},
journal= {arXiv preprint arXiv:1907.01041},
year = {2019}
}