FACTS grounding 评估榜:基准测试大语言模型对长文本输入的事实性 grounding 能力
计算与语言
2025-01-07 v1
摘要
我们介绍 FACTS Grounding,这是一个在线评估榜及其相关基准测试,旨在评估语言模型生成文本在给定上下文(用户提示)下的事实准确性。在我们的基准测试中,每个提示包含用户请求和完整文档,最大长度为 32k token,要求生成长形式响应。长形式响应必须在提供的上下文文件中完全 grounding,同时满足用户请求。采用自动评判模型进行评估,分为两个阶段:(1) 若不符合用户请求则淘汰;(2) 若响应完全基于提供的文档,则判定为准确。对自动评判模型进行了针对保留测试集的全面评估,以选取最佳提示模板,最终事实性得分是多个评判模型的综合得分,以缓解评估偏差。FACTS Grounding 评估榜将持续维护,包含公开和私人数据划分,既允许外部参与,又保护评估榜的完整性。可在 https://www.kaggle.com/facts-leaderboard 访问。
引用
@article{arxiv.2501.03200,
title = {The FACTS Grounding Leaderboard: Benchmarking LLMs' Ability to Ground Responses to Long-Form Input},
author = {Alon Jacovi and Andrew Wang and Chris Alberti and Connie Tao and Jon Lipovetz and Kate Olszewska and Lukas Haas and Michelle Liu and Nate Keating and Adam Bloniarz and Carl Saroufim and Corey Fry and Dror Marcus and Doron Kukliansky and Gaurav Singh Tomar and James Swirhun and Jinwei Xing and Lily Wang and Madhu Gurumurthy and Michael Aaron and Moran Ambar and Rachana Fellinger and Rui Wang and Zizhao Zhang and Sasha Goldshtein and Dipanjan Das},
journal= {arXiv preprint arXiv:2501.03200},
year = {2025}
}