中文

探索精确率与召回率以评估大语言模型的质量与多样性

计算与语言 2024-06-05 v3 机器学习

摘要

我们引入了一种针对 \textsc{Llama-2} 和 \textsc{Mistral} 等大语言模型(LLMs)的新型评估框架,重点是将图像生成中的精确率(Precision)和召回率(Recall)指标引入文本生成。这种方法无需对齐语料库即可对生成文本的质量和多样性进行细致评估。通过对最先进语言模型的全面评估,该研究揭示了它们在开放生成任务上的性能新见解,而这些是传统基准测试未能充分捕捉的。研究结果突显了生成样本质量与多样性之间的权衡,特别是在模型经过指令数据集微调或人类反馈优化的情况下。这项工作扩展了基于分布的 NLP 评估工具包,提供了关于当前 LLM 在生成多样化和高质量文本方面所面临的实际能力和挑战的见解。我们发布了我们的代码和数据。

关键词

引用

@article{arxiv.2402.10693,
  title  = {Exploring Precision and Recall to assess the quality and diversity of LLMs},
  author = {Florian Le Bronnec and Alexandre Verine and Benjamin Negrevergne and Yann Chevaleyre and Alexandre Allauzen},
  journal= {arXiv preprint arXiv:2402.10693},
  year   = {2024}
}

备注

21 pages, 15 figures, ACL 2024 Main