中文

RoCar:一种基于关系网络的大语言模型评估方法

计算与语言 2024-11-12 v2 人工智能

摘要

大语言模型(LLMs)受到越来越多的关注。然而,由于其能力的复杂性,如何合理评估 LLMs 的能力仍是一项有待解决的课题。我们提出了 RoCar 方法,该方法利用所定义的基础模式随机构建任务图,并基于任务图生成自然语言评估任务,分别评估 LLMs 的推理与记忆能力。由于任务构建过程具有极大的随机性,可确保待测试的 LLMs 均未直接学习过评估任务,从而保证了评估方法的公平性。

关键词

引用

@article{arxiv.2307.15997,
  title  = {RoCar: A Relationship Network-based Evaluation Method for Large Language Models},
  author = {Ming Wang and Wenfang Wu and Chongyun Gao and Daling Wang and Shi Feng and Yifei Zhang},
  journal= {arXiv preprint arXiv:2307.15997},
  year   = {2024}
}