使用大语言模型评估对话的三种方式
计算与语言
2023-08-15 v1 人工智能
摘要
本文描述了 team6 为 ChatEval(DSTC 11 Track 4 竞赛)提交的系统。我们提出了三种基于大语言模型(LLMs)预测聊天机器人回复的轮次级质量的不同方法。我们报告了通过使用来自向量存储的动态少样本示例为 ChatGPT 的提示词带来相对于基线的改进。我们还分析了另外两种方法的性能并报告了未来工作所需的改进。我们在仅仅两周内开发了这三个系统,展示了 LLMs 对该任务的潜力。在挑战截止日期后进行的消融研究表明,新的 Llama 2 模型正在缩小 ChatGPT 与开源 LLMs 之间的性能差距。然而,我们发现 Llama 2 模型并不像 ChatGPT 那样从少样本示例中受益。
引用
@article{arxiv.2308.06502,
title = {Three Ways of Using Large Language Models to Evaluate Chat},
author = {Ondřej Plátek and Vojtěch Hudeček and Patricia Schmidtová and Mateusz Lango and Ondřej Dušek},
journal= {arXiv preprint arXiv:2308.06502},
year = {2023}
}
备注
Accepted to DSTC11 workshop https://dstc11.dstc.community/