中文

针对比较评估任务的 LLM 微调

计算与语言 2024-09-25 v1

摘要

自然语言生成的自动评估是一项具有挑战性的任务。经过指令调优的大型语言模型(LLM)在无参考评估方面显示出前景,尤其是通过比较评估。然而,两两比较的二次计算复杂度限制了其可扩展性。为此,探索了通过对零-shot LLM 概率应用比较策略来实现高效比较评估。我们提出了一个框架,用于微调 LLM 以进行比较评估,以将模型的输出与比较概率的目标分布对齐。通过训练软概率,我们的方法在保持高性能的同时,提高了最新水平的性能,并使用高效的子集比较。

关键词

引用

@article{arxiv.2409.15979,
  title  = {Finetuning LLMs for Comparative Assessment Tasks},
  author = {Vatsal Raina and Adian Liusie and Mark Gales},
  journal= {arXiv preprint arXiv:2409.15979},
  year   = {2024}
}

备注

8 pages, 5 figures, 6 tables