中文

面向事实核查的数据高效自回归文档检索

计算与语言 2022-11-18 v1 人工智能 信息检索 机器学习

摘要

文档检索是许多知识密集型自然语言处理任务(如事实核查与问答)表述的核心组成部分。维基百科文章等文本知识来源对模型生成答案起到条件作用。近期检索领域的进展采用序列到序列模型,在给定查询时逐步预测合适维基百科页面的标题。然而,该方法需要以人工标注的形式监督哪些维基百科页面包含合适上下文。本文提出一种远程监督方法,无需任何标注即可训练自回归检索器,并在零样本设定下取得具有竞争力的 R-Precision 与召回率。此外,我们表明,通过任务特定的有监督微调,两个基于维基百科的事实核查任务的自回归检索性能可接近甚至超过全监督,而使用的标注数据少于 1/41/4,这指明了数据高效自回归检索的可能方向。

关键词

引用

@article{arxiv.2211.09388,
  title  = {Data-Efficient Autoregressive Document Retrieval for Fact Verification},
  author = {James Thorne},
  journal= {arXiv preprint arXiv:2211.09388},
  year   = {2022}
}

备注

To appear at SustaiNLP@EMNLP 2022. Code is available: https://github.com/j6mes/sustainlp2022-deardr