LLM-as-an-Interviewer:通过动态LLM评估超越静态测试
计算与语言
2025-06-03 v3 人工智能
摘要
我们提出LLM-as-an-Interviewer(LLM作为面试官),这是一种用于评估大型语言模型(LLM)的新范式。该方法利用多轮交互,LLM面试官主动提供对响应的反馈,并提出后续问题以询问被评估的LLM。在面试开始时,LLM面试官会动态修改数据集以生成初始问题,从而缓解数据污染。我们将LLM-as-an-Interviewer框架应用于MATH和DepthQA任务,对六个模型进行评估。我们的结果表明,该框架有效地提供了关于LLM性能的见解,包括初始响应质量、对反馈的适应性以及解决后续问题(如澄清或请求额外知识)的能力。该框架也解决了传统方法(如LLM-as-a-Judge)的关键局限性,包括 verbosity bias(冗长偏差)和跨运行不一致性。最后,我们提出面试报告(Interview Report),汇总了面试过程中获得的见解,提供示例并全面分析LLM的优势和不足。该报告为模型的实际应用提供了详细的快照。我们的框架代码已公开available at https://github.com/interview-eval/。
引用
@article{arxiv.2412.10424,
title = {LLM-as-an-Interviewer: Beyond Static Testing Through Dynamic LLM Evaluation},
author = {Eunsu Kim and Juyoung Suk and Seungone Kim and Niklas Muennighoff and Dongkwan Kim and Alice Oh},
journal= {arXiv preprint arXiv:2412.10424},
year = {2025}
}