锚点预测:一种主题建模方法
计算与语言
2022-06-02 v2
摘要
由超链接连接的文档网络(如维基百科)无处不在。作者插入超链接以丰富文本并便利网络导航。然而,作者往往只插入相关超链接中的一小部分,主要因为这耗时费力。本文处理一种标注任务,我们称之为锚点预测。尽管其在概念上接近链接预测或实体链接,但它是不同的任务,需要开发特定方法解决。给定源文档与目标文档,该任务在于自动识别源文档中的锚点,即应携带指向目标文档超链接的词语或术语。我们提出上下文关系主题模型CRTM,将文档间有向链接建模为源文档中锚点局部上下文与目标文档整体内容的函数。该模型可用于给定目标文档时预测源文档中的锚点,无需依赖已见提及或标题词典,也无需任何外部知识图谱。作者可受益于CRTM,给定新文档与待连接目标文档集,由其自动建议超链接。读者亦可受益,通过在其阅读文档间动态插入超链接。在多个维基百科语料库(英、意、德)上的实验凸显了锚点预测的实际效用并证明了我们方法的相关性。
引用
@article{arxiv.2205.14631,
title = {Anchor Prediction: A Topic Modeling Approach},
author = {Jean Dupuy and Adrien Guille and Julien Jacques},
journal= {arXiv preprint arXiv:2205.14631},
year = {2022}
}
备注
14 pages, correct typo and \citep