多语言事实链接
计算与语言
2021-10-04 v2
摘要
知识密集型 NLP 任务可以从将自然语言文本与知识图谱(KG)中的事实相链接中获益。尽管事实本身是语言无关的,但 KG 中的事实标签(即事实的特定语言表示)通常仅以少数语言存在。这使得将 KG 事实链接到有限语言集合以外的其他语言的句子具有挑战性。为了解决这个问题,我们引入了多语言事实链接(MFL)任务,其目标是将句子中表达的事实链接到 KG 中的对应事实,即使 KG 中的事实标签在该句子的语言中不可用。为了促进该领域的研究,我们提出了一个新的评估数据集 IndicLink。该数据集包含 11,293 个链接的 WikiData 事实和 6,429 个跨越英语和六种印度语言的句子。我们提出了一个 Retrieval+Generation 模型 ReFCoG,该模型通过将基于 Dual Encoder 的检索与基于 Seq2Seq 的生成模型相结合,能够扩展到数百万个 KG 事实,并约束其仅输出有效的 KG 事实。ReFCoG 在 Precision@1 上比标准的 Retrieval+Re-ranking 模型高出 10.7 个百分点。尽管有此提升,该模型的总体得分为 52.1,表明该任务仍有充足的改进空间。ReFCoG 代码和 IndicLink 数据可在 https://github.com/SaiKeshav/mfl 获取。
引用
@article{arxiv.2109.14364,
title = {Multilingual Fact Linking},
author = {Keshav Kolluru and Martin Rezk and Pat Verga and William W. Cohen and Partha Talukdar},
journal= {arXiv preprint arXiv:2109.14364},
year = {2021}
}
备注
AKBC 2021