Rescue:利用偏序对 LLM 响应排序以提升响应生成
计算与语言
2024-07-24 v3
摘要
针对特定任务定制 LLM 涉及将高质量响应与较低质量响应区分开。该技能可使用带有大量人类偏好数据的监督微调来培养。然而,对多数任务而言,获取大量专家标注数据成本高昂。本文中,我们探索一种利用排序指标优化 LLM 的新颖方法。该方法训练模型优先从为特定任务生成的候选池中挑选最佳响应。相较于传统的全排序,我们主张采用偏序,因为就候选响应的完美顺序达成共识颇具挑战。我们的偏序更鲁棒、对噪声更不敏感,且可借助有限人工标注或启发式方法实现。我们使用基准数据集(包括文本蕴含与多文档问答)测试系统提升的响应生成能力。我们进行消融研究以理解关键因素,例如如何为特定任务收集候选响应、确定其最合适顺序,以及平衡监督微调与排序指标。我们的方法名为 Rescue,为增强 LLM 的响应生成与任务准确性提供了有前景的途径。
引用
@article{arxiv.2311.09136,
title = {Rescue: Ranking LLM Responses with Partial Ordering to Improve Response Generation},
author = {Yikun Wang and Rui Zheng and Haoming Li and Qi Zhang and Tao Gui and Fei Liu},
journal= {arXiv preprint arXiv:2311.09136},
year = {2024}
}
备注
ACL 2024 SRW