Teach2Eval: An Indirect Evaluation Method for LLM by Judging How It Teaches
计算与语言
2025-05-20 v1
摘要
近期大语言模型(LLM)的进展远远超过有效评估方法的发展。传统基准测试依赖于任务特定的指标和静态数据集,往往 suffer from fairness issues, limited scalability, and contamination risks。本文引入 Teach2Eval,一种受费曼技巧启发的间接评估框架。与直接在预定义任务上测试 LLM 不同,我们的方法通过评估模型教导更弱学生模型有效完成任务的能力来评估其多种能力。通过将开放式任务转换为通过教师生成的反馈转化为标准化多选题(MCQs),Teach2Eval 实现了可扩展、自动化和多维度的评估。我们的做法不仅避免了数据泄露和记忆,还捕捉了与当前基准测试正交的广泛认知能力。跨 26 种领先 LLM 的实验结果显示,Teach2Eval 与现有人类和基于模型的动态排名高度一致,同时为训练指导提供了额外的可解释性。
引用
@article{arxiv.2505.12259,
title = {Teach2Eval: An Indirect Evaluation Method for LLM by Judging How It Teaches},
author = {Yuhang Zhou and Xutian Chen and Yixin Cao and Yuchen Ni and Yu He and Siyu Tian and Xiang Liu and Jian Zhang and Chuanjun Ji and Guangnan Ye and Xipeng Qiu},
journal= {arXiv preprint arXiv:2505.12259},
year = {2025}
}