RiDiC年鉴:用于长篇事实性评估的受控流行度分布数据集生成
计算与语言
2026-04-02 v1 人工智能
摘要
我们提出一个可配置的管道,用于生成具有指定特征(如领域、地理位置和流行度)的多语言实体数据集,采用来自维基百科和维基数据的数据。这些数据旨在评估大语言模型(LLM)长篇生成的事实性,从而补充基于短篇问答数据集的评估。我们以RiDiC数据集作为这一方法的示例。RiDiC包含3,000个来自三个领域(河流、自然灾害和汽车型号)的实体,覆盖不同流行度层级。每个实体附带其地理位置、英文和中文名称(如有)以及相关的英文和中文维基百科内容,用于评估LLM的响应。我们获得了来自三个LLM(英文和中文)关于RiDiC实体的生成结果,这些结果经第三方事实性检查器评估后表明,即便是前沿模型也会对这些实体产生幻觉。为便于多语言环境下评估LLM的长篇事实性,我们已公开代码、数据以及生成/评估脚本。
引用
@article{arxiv.2604.00019,
title = {The Chronicles of RiDiC: Generating Datasets with Controlled Popularity Distribution for Long-form Factuality Evaluation},
author = {Pavel Braslavski and Dmitrii Iarosh and Nikita Sushko and Andrey Sakhovskiy and Vasily Konovalov and Elena Tutubalina and Alexander Panchenko},
journal= {arXiv preprint arXiv:2604.00019},
year = {2026}
}
备注
Accepted to LREC 2026