中文

基于隐含主题的长度各异文本间文档相似度计算

计算与语言 2019-03-27 v1

摘要

度量文本间相似度是若干应用中的一项重要任务。现有的文档相似度度量方法对于长度不可比的文档对(如长文档与其摘要)并不充分。这是因为富含细节的长文档与其抽象信息的简明摘要之间存在词汇、上下文与抽象性鸿沟。在本文中,我们提出一种文档匹配方法以弥合这一鸿沟,通过在隐含主题的共同空间中比较文本。我们在两个匹配任务上评估该匹配算法,发现其持续且广泛地优于强基线方法。我们还强调了将领域知识引入文本匹配的好处。

关键词

引用

@article{arxiv.1903.10675,
  title  = {Document Similarity for Texts of Varying Lengths via Hidden Topics},
  author = {Hongyu Gong and Tarek Sakakini and Suma Bhat and Jinjun Xiong},
  journal= {arXiv preprint arXiv:1903.10675},
  year   = {2019}
}