论辩智能:通过辩论演讲评估对标LLM评判官
计算与语言
2025-09-10 v2
摘要
我们引入辩论演讲评估作为评估LLM评判官的一种新型且具挑战性的基准测试。评估辩论演讲需要对演讲在多个层面上进行深入理解,包括论点强度与相关性、演讲的连贯性与组织结构、风格与语气的恰当性等。该任务涉及一套独特的认知能力,这些能力此前在系统性LLM基准测试中受到有限关注。为探索这些技能,我们构建了包含600多个精细标注辩论演讲的数据集,并对当前最先进LLM在该任务上与人类评判官的表现进行首次深入分析。我们的发现揭示了复杂的图景:尽管大型模型在某些方面能够逼近人类判断,但在整体判断行为上存在显著差异。我们还调查了前沿LLM生成具有说服力和立场的演讲能力,表明模型在该任务上可达到人类水平。
引用
@article{arxiv.2506.05062,
title = {Debatable Intelligence: Benchmarking LLM Judges via Debate Speech Evaluation},
author = {Noy Sternlicht and Ariel Gera and Roy Bar-Haim and Tom Hope and Noam Slonim},
journal= {arXiv preprint arXiv:2506.05062},
year = {2025}
}
备注
EMNLP 2025. Code: https://github.com/noy-sternlicht/Debatable-Intelligence