将维基百科文章链接预测作为自然语言推理任务
计算与语言
2023-09-06 v2
摘要
链接预测任务对于自动理解大型知识库的结构至关重要。本文介绍了我们在 Data Science and Advanced Analytics 2023 竞赛“高效且有效的链接预测”(DSAA-2023 Competition)中解决该任务的系统,该竞赛语料包含 948,233 条训练样本与 238,265 条公开测试样本。本文通过将链接预测表述为自然语言推理(NLI)任务,引入了一种维基百科文章中的链接预测方法。受自然语言处理与理解近期进展的启发,我们将链接预测视为一项 NLI 任务,其中两篇文章间存在链接被视为前提,而任务是根据文章所呈现的信息判断该前提是否成立。我们基于面向维基百科文章链接预测任务的句子对分类实现了我们的系统。我们的系统在公开与私有测试集上分别取得了 0.99996 与 1.00000 的宏 F1 分数。我们的团队 UIT-NLP 在私有测试集上性能排名第 3,与第一名和第二名的分数持平。我们的代码已公开以供研究之用。
引用
@article{arxiv.2308.16469,
title = {Link Prediction for Wikipedia Articles as a Natural Language Inference Task},
author = {Chau-Thang Phan and Quoc-Nam Nguyen and Kiet Van Nguyen},
journal= {arXiv preprint arXiv:2308.16469},
year = {2023}
}
备注
Accepted at the 10th IEEE International Conference On Data Science And Advanced Analytics (DSAA 2023)