针对比较评估任务的 LLM 微调
计算与语言
2024-09-25 v1
摘要
自然语言生成的自动评估是一项具有挑战性的任务。经过指令调优的大型语言模型(LLM)在无参考评估方面显示出前景,尤其是通过比较评估。然而,两两比较的二次计算复杂度限制了其可扩展性。为此,探索了通过对零-shot LLM 概率应用比较策略来实现高效比较评估。我们提出了一个框架,用于微调 LLM 以进行比较评估,以将模型的输出与比较概率的目标分布对齐。通过训练软概率,我们的方法在保持高性能的同时,提高了最新水平的性能,并使用高效的子集比较。
引用
@article{arxiv.2409.15979,
title = {Finetuning LLMs for Comparative Assessment Tasks},
author = {Vatsal Raina and Adian Liusie and Mark Gales},
journal= {arXiv preprint arXiv:2409.15979},
year = {2024}
}
备注
8 pages, 5 figures, 6 tables