中文

用于可解释长文档匹配的监督对比学习

信息检索 2022-06-03 v2

摘要

深度学习技术的最新进展改变了语义文本匹配领域。然而,大多数最先进的模型被设计为处理推文、用户评论、评论等短文档。这些模型在应用于科学论文、法律文档和专利等长文档时有根本局限。处理此类长文档时存在三个主要挑战:(i) 同一词在文档各处存在不同上下文,(ii) 两文档间存在上下文相似的小段落,但其余部分不相似(这违背了对“相似性”的基本理解),以及(iii) 单一全局相似性度量的粗粒度性质无法捕捉文档内容的异质性。在本文中,我们描述CoLDE:对比长文档编码器——一个基于transformer的框架,解决这些挑战并允许对长文档进行可解释比较。CoLDE使用独特的位置嵌入与多头分块注意力层,结合监督对比学习框架,在三个不同层级捕捉相似性:(i) 文档对之间的高层相似性分数,(ii) 文档内与跨文档不同小节之间的相似性分数,以及(iii) 同一文档内与跨其他文档不同块之间的相似性分数。这些细粒度相似性分数有助于更好的可解释性。我们在三个长文档数据集上评估CoLDE,即ACL Anthology出版物、Wikipedia文章和USPTO专利。除了在文档匹配任务上优于最先进方法外,CoLDE对文档长度和文本扰动的变化也具有鲁棒性,并提供可解释结果。

关键词

引用

@article{arxiv.2108.09190,
  title  = {Supervised Contrastive Learning for Interpretable Long-Form Document Matching},
  author = {Akshita Jha and Vineeth Rakesh and Jaideep Chandrashekar and Adithya Samavedhi and Chandan K. Reddy},
  journal= {arXiv preprint arXiv:2108.09190},
  year   = {2022}
}