中文

使用大语言模型评估对话的三种方式

计算与语言 2023-08-15 v1 人工智能

摘要

本文描述了 team6 为 ChatEval(DSTC 11 Track 4 竞赛)提交的系统。我们提出了三种基于大语言模型(LLMs)预测聊天机器人回复的轮次级质量的不同方法。我们报告了通过使用来自向量存储的动态少样本示例为 ChatGPT 的提示词带来相对于基线的改进。我们还分析了另外两种方法的性能并报告了未来工作所需的改进。我们在仅仅两周内开发了这三个系统,展示了 LLMs 对该任务的潜力。在挑战截止日期后进行的消融研究表明,新的 Llama 2 模型正在缩小 ChatGPT 与开源 LLMs 之间的性能差距。然而,我们发现 Llama 2 模型并不像 ChatGPT 那样从少样本示例中受益。

关键词

引用

@article{arxiv.2308.06502,
  title  = {Three Ways of Using Large Language Models to Evaluate Chat},
  author = {Ondřej Plátek and Vojtěch Hudeček and Patricia Schmidtová and Mateusz Lango and Ondřej Dušek},
  journal= {arXiv preprint arXiv:2308.06502},
  year   = {2023}
}

备注

Accepted to DSTC11 workshop https://dstc11.dstc.community/