中文

RefuteBench 2.0 -- 基于LLM代理的动态评估大语言模型对反驳指令响应能力的基准

星系天体物理 2025-03-11 v1

摘要

在多轮交互模式中,大语言模型(LLM)可以利用用户反馈来增强其响应的质量和相关性。然而,评估LLM 吸收用户反驳反馈的能力至关重要且具有挑战性。在本研究中,我们引入RefuteBench 2.0,该基准显著扩展了原始RefuteBench,通过将LLM 代理作为反驳者和评估者,实现了灵活且全面的评估。我们设计了transient 和 persistent 两种反驳指令,具有不同的有效期。元评估显示,基于LLM的反驳者能够生成更符合人类水平的反驳,评估者能够给出与人类高度相关的评分。实验结果表明,各种LLM 都能有效满足反驳要求,但无法记忆反驳信息。有趣的是,我们还观察到随着反驳的增加,初始任务的性能会下降。进一步分析注意力得分显示,当前LLM 存在潜在弱点:在长上下文对话期间,难以保留并正确使用先前信息。https://github.com/ElliottYan/RefuteBench-2.0

关键词

引用

@article{arxiv.2502.18306,
  title  = {Water Nucleation via Transient Bonds to Oxygen Functionalized Graphite},
  author = {Frederik G. Doktor and Niels M. Mikkelsen and Signe Kyrkjebø and Prashant Srivastava and Richard Balog and Bjørk Hammer and Karina Morgenstern and Liv Hornekær},
  journal= {arXiv preprint arXiv:2502.18306},
  year   = {2025}
}