中文

CORE:大型语言模型的综合本体关系评估

计算与语言 2026-02-09 v1 人工智能 机器学习

摘要

大型语言模型在众多推理基准测试中表现出色,但现有评估极少衡量其区分有意义语义关系与真正无关性的能力。我们引入 CORE(Comprehensive Ontological Relation Evaluation),一个包含 225K 题的多选问答数据集,覆盖 74 个学科,另外构建了一个包含 203 个经过严格验证的通用领域开源基准(Kappa=1.0),覆盖 24 种语义关系类型,无关配对表示均等。超过 1000 名参与者的人类基准在 92.6% 的准确率(无关配对为 95.1%)上取得。相比之下,29 个最新 LLM 在整体准确率上达 48.25-70.9%,在相关配对上表现接近极限(86.5-100%),但在无关配对上显著下降(0-41.35%),尽管置信度相近(92-94%)。预期校准误差在无关配对上增加 2-4 倍,平均语义坍缩率为 37.6%,表明系统性生成虚构关系。在 CORE 225K 多选问答数据集上,准确率进一步下降至约 2%,凸显了领域特定语义推理的重大挑战。我们指出无关性推理是 LLM 评估与安全中的关键且未被充分评估的前沿。

关键词

引用

@article{arxiv.2602.06446,
  title  = {CORE: Comprehensive Ontological Relation Evaluation for Large Language Models},
  author = {Satyam Dwivedi and Sanjukta Ghosh and Shivam Dwivedi and Nishi Kumari and Anil Thakur and Anurag Purushottam and Deepak Alok and Praveen Gatla and Manjuprasad B and Bipasha Patgiri},
  journal= {arXiv preprint arXiv:2602.06446},
  year   = {2026}
}