中文

DRE:一种有效的双精炼方法,用于整合小型和大型语言模型以进行开放域对话评估

计算与语言 2025-06-06 v1

摘要

大型语言模型(LLMs)在许多任务中表现出色,但在存在多个有效响应的模糊场景中常常难以处理,往往产生不可靠的结果。相比之下,小型语言模型(SLMs)在此类场景中表现稳健,但却容易受到误导性或对抗性输入的影响。我们观察到,LLMs在处理负例时表现良好,而SLMs在处理正例时更为出色。为充分利用两者的互补优势,我们引入了SLIDE(Small and Large Integrated for Dialogue Evaluation),通过自适应加权整合SLMs和LLMs。基于SLIDE,我们进一步提出了双精炼评估(DRE)方法以增强SLM-LLM集成:(1)由SLM生成的见解引导LLM产生初始评估;(2)由SLM派生的调整细化LLM的评分,以提高准确性。实验表明,DRE超越了现有方法,在多样化的基准测试中与人类判断的对齐度更强。这一工作说明,结合小型和大型模型可产生更可靠的评估工具,特别适用于诸如对话评估等开放性任务。

关键词

引用

@article{arxiv.2506.04516,
  title  = {DRE: An Effective Dual-Refined Method for Integrating Small and Large Language Models in Open-Domain Dialogue Evaluation},
  author = {Kun Zhao and Bohao Yang and Chen Tang and Siyuan Dai and Haoteng Tang and Chenghua Lin and Liang Zhan},
  journal= {arXiv preprint arXiv:2506.04516},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2405.15924