中文

SciFix:在科学事实错误修正上超越GPT3

计算与语言 2023-10-16 v2 人工智能 机器学习

摘要

由于创建错误修正数据集的成本极高,多数事实声明修正方法依赖强大的验证模型来引导修正过程。这导致在科学声明等领域性能显著下降,因为该领域并不总是存在良好的验证模型。本工作中,我们引入SciFix,一个无需验证器却能大幅超越现有方法的科学声明修正系统——在SciFact数据集上达到84%的修正准确率,在SciFact-Open上77%,在CovidFact数据集上72%,而上述各数据集上次优准确率分别仅为7%、5%与15%。我们的方法利用训练时LLMs提示的力量来创建可应用于全监督训练与正则化的丰富标注数据集。我们额外使用声明感知解码过程来提升修正声明的质量。我们的方法超越了用于生成标注数据集的那个LLM本身——GPT3.5上的少样本提示在相应数据集上分别仅达58%、61%与64%的修正准确率,尽管其参数量近乎我们的800倍,准确率却始终更低。

关键词

引用

@article{arxiv.2305.14707,
  title  = {SciFix: Outperforming GPT3 on Scientific Factual Error Correction},
  author = {Dhananjay Ashok and Atharva Kulkarni and Hai Pham and Barnabás Póczos},
  journal= {arXiv preprint arXiv:2305.14707},
  year   = {2023}
}

备注

To appear in proceedings of EMNLP2023 (findings)