基于数据科学方法识别语义重复问题:以 Quora 为例
信息检索
2020-04-27 v1 机器学习
机器学习
摘要
在 Quora 等问答社交媒体平台上识别语义相同的问题极为重要,可确保基于问题意图向用户呈现内容的质量与数量,从而丰富整体用户体验。检测重复问题是一项挑战性任务,因为自然语言极具表现力,且唯一意图可通过不同词汇、短语与句子结构传达。机器学习与深度学习方法在识别相似文本方面已知优于传统自然语言处理技术。在本文中,以 Quora 为案例,我们探索并应用了不同机器学习与深度学习技术于识别 Quora 数据集上重复问题的任务。通过使用特征工程、特征重要性技术,并以七个选定机器学习分类器实验,我们证明了我们的模型在此任务上优于既往研究。带有字符级词频与逆词频的 Xgboost 模型是我们最佳的机器学习模型,其也优于若干深度学习基线模型。我们应用深度学习技术建模了四种不同的多层深度神经网络,由 Glove 嵌入、长短期记忆、卷积、最大池化、全连接、批归一化、激活函数与模型融合组成。我们的深度学习模型取得了优于机器学习模型的准确率。所提四种架构中有三种准确率优于既往机器学习与深度学习研究工作,四种中有两种优于既往 Quora 问题对数据集上的深度学习研究,我们最佳模型达到了 85.82% 的准确率,接近 Quora 最先进准确率。
引用
@article{arxiv.2004.11694,
title = {Identifying Semantically Duplicate Questions Using Data Science Approach: A Quora Case Study},
author = {Navedanjum Ansari and Rajesh Sharma},
journal= {arXiv preprint arXiv:2004.11694},
year = {2020}
}
备注
11 pages, 8 figures, 8 tables