[重述] 基于可评分游戏对 LLM 谈判能力进行基准测试
机器学习
2026-02-24 v1 人工智能
摘要
大型语言模型 (LLMs) 在多智能体谈判任务中展现出显著潜力,但由于缺乏稳健且可推广的基准测试,评估仍具挑战性。Abdelnabi 等人 (2024) 引入一种基于可评分游戏的谈判基准测试,旨在开发高度复杂且真实的 LLM 评估框架。我们的工作调查了其基准测试声明的可复现性,并提供对其可用性和可推广性的更深入理解。我们在额外模型上复制了原始实验,并引入额外指标来验证谈判质量和评估的公平性。我们的发现表明,尽管该基准测试确实复杂,但模型间的比较仍含歧义,这引发了其客观性问题。此外,我们识别出实验设置中的局限性,特别是信息泄露检测和剖析研究的彻底性方面。通过在更广泛的模型范围内对该基准测试的延伸版本进行行为分析,我们揭示了为潜在用户提供额外背景信息的洞见。我们的结果凸显了在模型比较评估中背景的重要性。
引用
@article{arxiv.2602.18230,
title = {[Re] Benchmarking LLM Capabilities in Negotiation through Scoreable Games},
author = {Jorge Carrasco Pollo and Ioannis Kapetangeorgis and Joshua Rosenthal and John Hua Yao},
journal= {arXiv preprint arXiv:2602.18230},
year = {2026}
}
备注
Accepted for publication at Transactions on Machine Learning Research (TMLR) and MLRC Journal Track, 2025. Code available at: https://github.com/joshrosie/FACT29