中文

评估中的生成式 AI 悖论:能求解者未必能评估

计算与语言 2026-03-09 v1 人工智能 人机交互

摘要

本文探讨了这样一个假设:擅长生成任务的大型语言模型(LLM)同样擅长作为评估者。我们使用 TriviaQA (Joshi et al., 2017) 数据集评估了三个 LLM 和一个开源语言模型在问答(QA)和评估任务中的表现。结果表明存在显著差异,与生成任务相比,LLM 在评估任务中的表现较差。有趣的是,我们发现了不忠实评估的实例,即模型在其缺乏能力的领域准确评估了答案,这突显了审查 LLM 作为评估者的忠实性和可信度的必要性。本研究有助于理解“生成式 AI 悖论”(West et al., 2023),强调了探索生成能力与评估能力之间相关性的必要性,以及在模型评估中审查忠实性方面的必要性。

关键词

引用

@article{arxiv.2402.06204,
  title  = {The Generative AI Paradox on Evaluation: What It Can Solve, It May Not Evaluate},
  author = {Juhyun Oh and Eunsu Kim and Inha Cha and Alice Oh},
  journal= {arXiv preprint arXiv:2402.06204},
  year   = {2026}
}