FACTORY:一个具有挑战性的人类验证提示集合用于长篇事实性
计算与语言
2025-08-04 v1 人工智能
摘要
长篇事实性评估评估模型生成对短提示准确、全面的响应能力。现有基准往往缺乏人类验证,导致潜在质量问题。为解决这一局限,我们引入FACTORY,一个大规模的人类验证提示集合。采用模型在环方法开发,经人类细化,FACTORY包含具有挑战性的提示,这些提示在事实寻求、可作答且明确性方面。我们对6种最先进的语言模型使用FACTORY和现有数据集进行了人类评估。我们的结果表明FACTORY是一个具有挑战性的基准:约有40%的SOTA模型响应中的主张不为事实,而其他数据集仅为10%。我们的分析确定了FACTORY相对于先前基准的优势,强调其可靠性以及模型必须跨越长尾事实进行推理的必要性。
引用
@article{arxiv.2508.00109,
title = {FACTORY: A Challenging Human-Verified Prompt Set for Long-Form Factuality},
author = {Mingda Chen and Yang Li and Xilun Chen and Adina Williams and Gargi Ghosh and Scott Yih},
journal= {arXiv preprint arXiv:2508.00109},
year = {2025}
}