中文

UniArk: 通过消除偏见提升事实知识抽取的泛化与一致性

计算与语言 2024-04-02 v1

摘要

最近的几篇论文探讨了语言模型作为知识库的潜力,以及在抽取事实知识时存在严重偏见的问题。本文聚焦于对来自调优和使用未见提示的事实探测性能进行评估,我们从概率视角显示语言模型在探测知识方程式和下游调优目标之间的内在错位。我们假设同时消除这些目标可能是解决未见提示下泛化的关键。我们提出一种基于适配器的框架,称为 UniArk,通过无需引入额外参数的简单方法实现通用且一致的事实知识抽取。大量实验表明,UniArk 能显著提高模型在各种提示下下的域外泛化能力和一致性。此外,我们构建了 ParaTrex,一个大规模且多样化的数据集,用于衡量模型的不一致性和跨域生成。进一步地,ParaTrex 提供了使用大型语言模型构建改写数据集的方法。

关键词

引用

@article{arxiv.2404.01253,
  title  = {UniArk: Improving Generalisation and Consistency for Factual Knowledge Extraction through Debiasing},
  author = {Yijun Yang and Jie He and Pinzhen Chen and Víctor Gutiérrez-Basulto and Jeff Z. Pan},
  journal= {arXiv preprint arXiv:2404.01253},
  year   = {2024}
}

备注

NAACL 2024