评估中的生成式 AI 悖论:能求解者未必能评估
计算与语言
2026-03-09 v1 人工智能
人机交互
摘要
本文探讨了这样一个假设:擅长生成任务的大型语言模型(LLM)同样擅长作为评估者。我们使用 TriviaQA (Joshi et al., 2017) 数据集评估了三个 LLM 和一个开源语言模型在问答(QA)和评估任务中的表现。结果表明存在显著差异,与生成任务相比,LLM 在评估任务中的表现较差。有趣的是,我们发现了不忠实评估的实例,即模型在其缺乏能力的领域准确评估了答案,这突显了审查 LLM 作为评估者的忠实性和可信度的必要性。本研究有助于理解“生成式 AI 悖论”(West et al., 2023),强调了探索生成能力与评估能力之间相关性的必要性,以及在模型评估中审查忠实性方面的必要性。
引用
@article{arxiv.2402.06204,
title = {The Generative AI Paradox on Evaluation: What It Can Solve, It May Not Evaluate},
author = {Juhyun Oh and Eunsu Kim and Inha Cha and Alice Oh},
journal= {arXiv preprint arXiv:2402.06204},
year = {2026}
}