AA-Omniscience:评估大型语言模型跨域知识可靠性
计算与语言
2025-11-18 v1 人工智能
摘要
现有的语言模型评估主要衡量通用能力,但可靠地在实际应用中使用这些模型需要事实准确性和对知识缺口的识别。我们引入 AA-Omniscience,一个设计用于衡量事实记忆和知识校准跨 6000 个问题的基准。问题来源于权威的学术和行业来源,涵盖六个不同领域的 42 个经济相关主题。该评估测量模型的 Omniscience 指数,这是一种有界指标(-100 到 100),衡量事实记忆,同时惩罚幻觉并奖励在不确定时选择沉默,0 表示模型在正确回答问题时也会错误回答问题。对于评估的模型,Claude 4.1 Opus 获得了最高分(4.8),是仅三个得分超过 0 的模型之一。这些结果揭示了前沿模型在事实性和校准方面的持续弱点。性能也因领域而异,三个不同研究实验室的模型在六个领域中各自领先。这一性能差异性表明,对于知识至关重要的任务,应根据具体需求选择模型,而非仅凭一般性能。
关键词
引用
@article{arxiv.2511.13029,
title = {AA-Omniscience: Evaluating Cross-Domain Knowledge Reliability in Large Language Models},
author = {Declan Jackson and William Keating and George Cameron and Micah Hill-Smith},
journal= {arXiv preprint arXiv:2511.13029},
year = {2025}
}