Stack Overflow 上的问题相关性:任务、数据集与受语料启发之模型
计算与语言
2019-05-08 v2 人工智能
摘要
领域特定的社区问答正成为职业工作不可或缺的一部分。在这些社区中寻找相关问题和答案可以显著提高信息搜索的效果和效率。Stack Overflow 是被数百万程序员使用的最受欢迎的社区之一。在本文中,我们分析了在 Stack Overflow 中预测知识单元(问题线程)相关性的问题。特别地,我们将问题相关性任务形式化为一个具有四个相关程度的多类分类问题。我们提出了一个包含超过 300K 对的大规模数据集。据我们所知,该数据集是规模最大的用于问题-问题相关性的领域特定数据集。我们展示了为收集、清洗、处理并确保数据集质量所采取的步骤。所提出的 Stack Overflow 数据集是一个有用的资源,可用于开发新颖的解决方案,特别是数据饥渴的神经网络模型,用于技术社区问答论坛中的相关性预测。我们针对该任务采用了一种神经网络架构和一种传统模型,它们有效地利用来自知识单元不同部分的信息来计算它们之间的相关性。这些模型可用于基准测试新颖模型,因为它们在我们的任务和一个高度相似的任务中表现良好。
引用
@article{arxiv.1905.01966,
title = {Question Relatedness on Stack Overflow: The Task, Dataset, and Corpus-inspired Models},
author = {Amirreza Shirani and Bowen Xu and David Lo and Thamar Solorio and Amin Alipour},
journal= {arXiv preprint arXiv:1905.01966},
year = {2019}
}