Core:基于信息性子主张识别的稳健事实精确度
计算与语言
2024-10-17 v2
摘要
幻觉是大语言模型(LLM)应用于实际场景中的一个挑战,从而激励了开发用于评估事实精确度的指标。我们观察到,使用分解-验证框架(如 \FActScore)的流行指标可以被通过添加显而易见或重复的子主张来人为地人为地提高分数。这一观察激励我们提出一个可自定义的即插即用子主张选择组件,称为 Core,它根据子主张的唯一性和信息性对其进行筛选。我们展示了许多流行的事实精确度指标augmented by Core 在广泛知识领域中要更稳健。我们发布了一个支持 Core 以及各种分解策略的易于使用且模块化的评估框架,建议社区采用。我们还扩充了 FActScore 传记数据集,以促进基于分解的事实精确度评估的进一步研究。
引用
@article{arxiv.2407.03572,
title = {Core: Robust Factual Precision with Informative Sub-Claim Identification},
author = {Zhengping Jiang and Jingyu Zhang and Nathaniel Weir and Seth Ebner and Miriam Wanner and Kate Sanders and Daniel Khashabi and Anqi Liu and Benjamin Van Durme},
journal= {arXiv preprint arXiv:2407.03572},
year = {2024}
}