建模 Elo 排名评审系统中 LLM 代理评审者动态
计算与语言
2026-01-14 v1 人工智能
摘要
本文探讨了在 Elo 排名评审系统中运用真实世界会议论文提交情况对大语言模型 (LLM) 代理评审者动态的建模。我们让多个具有不同人格特征的 LLM 代理评审者在由区域主席主持的多轮评审交互中进行协作。我们比较了基线设置与包含 Elo 评分和评审记忆的条件。我们的仿真结果展示了若干有趣的发现,包括在包含 Elo 评分后如何提升区域主席的决策准确性,以及评审者如何在不增加评审工作量的情况下利用我们的 Elo 系统进行自适应评审策略。我们的代码已公开于 https://github.com/hsiangwei0903/EloReview。
引用
@article{arxiv.2601.08829,
title = {Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System},
author = {Hsiang-Wei Huang and Junbin Lu and Kuang-Ming Chen and Jenq-Neng Hwang},
journal= {arXiv preprint arXiv:2601.08829},
year = {2026}
}
备注
In submission. The first two authors contributed equally