中文

多语言链接语料库中的实体插入:以维基百科为例

计算与语言 2024-10-08 v1 人工智能 信息检索 机器学习 社会与信息网络

摘要

链接是信息网络的基本组成部分,将孤立的知识片段转化为远非其本身之和的更丰富信息网络。然而,向网络添加新链接并非易事:这既需要识别合适的源实体与目标实体的配对,又需要理解源内容以定位链接在文本中合适的位置。后者问题在缺乏可作为锚文本插入目标实体链接的文本片段时尤为未被有效解决。为弥合这一差距,我们提出并操作化了信息网络中的实体插入任务。聚焦维基百科案例,我们经验性地表明该问题对编辑者而言既是相关的又是具有挑战性的。我们编译了包含105种语言的基准数据集,并开发了名为LocEI(局部实体插入)及其多语言变体XLocEI的框架。我们表明XLocEI在所有基线模型(包括如GPT-4等大型语言模型的SOTA提示基排序)上均取得优异成绩,并且可以零样本方式应用于训练期未见的语言,性能下降最小。这些发现对于在实践中应用实体插入模型具有重要意义,例如支持编辑在维基百科超过300种语言版本中添加链接。

关键词

引用

@article{arxiv.2410.04254,
  title  = {Entity Insertion in Multilingual Linked Corpora: The Case of Wikipedia},
  author = {Tomás Feith and Akhil Arora and Martin Gerlach and Debjit Paul and Robert West},
  journal= {arXiv preprint arXiv:2410.04254},
  year   = {2024}
}

备注

EMNLP 2024; 24 pages; 62 figures