中文

程序性教学文档的稀疏图表示

计算与语言 2024-02-07 v1

摘要

文档相似度计算是自然语言处理各领域中的关键任务,应用于去重、匹配和推荐。传统的文档相似度计算方法包括学习文档表示并对嵌入向量使用相似度或距离函数。然而,成对相似性和差异性无法被单个表示有效捕获。图表示如联合概念交互图(JCIG)将一对文档表示为联合无向加权图。JCIG促进了文档对的可解释图表示。然而,JCIG是无向的,没有考虑文档中句子的顺序流。我们提出了两种方法,通过将文档对表示为有向且稀疏的JCIG来建模文档相似度,该JCIG融入了顺序信息。我们提出了两种受超基因组排序和哈密顿路径启发的算法,用有向边替换无向边。我们的方法还将图稀疏化为O(n)条边,而JCIG最坏情况为O(n^2)。我们展示了由孪生编码器和图卷积网络组成的稀疏有向图模型架构,在不包含顺序信息的数据集上取得了与基线相当的结果,并在包含顺序信息的教学文档数据集上比基线高出十个点。

关键词

引用

@article{arxiv.2402.03957,
  title  = {Sparse Graph Representations for Procedural Instructional Documents},
  author = {Shruti Singh and Rishabh Gupta},
  journal= {arXiv preprint arXiv:2402.03957},
  year   = {2024}
}