中文

通过基于细粒度批判的评估器改进模型事实性

计算与语言 2025-06-03 v3

摘要

事实性评估旨在检测语言模型(LM)产生的事实性错误,从而指导开发更具事实性的模型。为此目标,我们训练了一个事实性评估器FenCE,为LM生成器提供基于主张的事实性反馈。我们对组合多个公开判决数据集进行数据增强,以训练FenCE实现(1)生成带评分的文本批判,以及(2)基于通过各种工具获取的多样化来源文档进行主张级别的判断。随后,我们提出一个框架,利用FenCE改进LM生成器的事实性,通过构建训练数据。具体而言,我们生成一组候选响应,利用FenCE对每个响应进行修订和评分,而不引入陌生事实,然后通过优先选择高评分的修订响应来训练生成器。实验表明,我们的数据增强方法在LLM-AggreFact上将评估器的准确率提高了2.9%。使用FenCE,我们将Llama2-7B-chat和Llama3-8B-chat的事实性提升了16.86%和14.45%,在FActScore上超越最先进的事实性微调方法8.83%和6.96%。

关键词

引用

@article{arxiv.2410.18359,
  title  = {Improving Model Factuality with Fine-grained Critique-based Evaluator},
  author = {Yiqing Xie and Wenxuan Zhou and Pradyot Prakash and Di Jin and Yuning Mao and Quintin Fettes and Arya Talebzadeh and Sinong Wang and Han Fang and Carolyn Rose and Daniel Fried and Hejia Zhang},
  journal= {arXiv preprint arXiv:2410.18359},
  year   = {2025}
}