中文

理解超大语言模型在对话评估上的有效性

计算与语言 2023-01-31 v1

摘要

近年来语言模型的规模稳步增长,其在问答、摘要等多种自然语言处理(NLP)任务上达到高水平性能。大语言模型(LLMs)已被用于生成,并现可输出类人文本。因此,对话领域中其他下游任务如今可利用 LLMs 的语言理解能力。对话评估是本文探讨的一项任务。它聚焦于使用 LLMs 进行提示:BLOOM、OPT、GPT-3、Flan-T5、InstructDial 与 TNLGv2。本文表明,用于训练模型的数据集之选择既影响其在任务上的表现,也影响提示应如何构建。具体而言,模型所训练的数据集组合越多样且相关,对话评估表现越好。本文还研究了提示中示例数量及所用示例选择类型如何影响模型性能。

关键词

引用

@article{arxiv.2301.12004,
  title  = {Understanding the Effectiveness of Very Large Language Models on Dialog Evaluation},
  author = {Jessica Huynh and Cathy Jiao and Prakhar Gupta and Shikib Mehri and Payal Bajaj and Vishrav Chaudhary and Maxine Eskenazi},
  journal= {arXiv preprint arXiv:2301.12004},
  year   = {2023}
}

备注

Accepted for publication at IWSDS 2023