LLM的协作:用于合成偏好优化数据集生成的多模型工作流
计算与语言
2025-08-18 v7 人工智能
摘要
本文提出了一种利用多模型工作流生成合成偏好优化(PO)数据集的新方法。我们评估了这些工作流在自动化和增强数据集生成过程中的有效性和潜力。PO数据集生成需要两个模块:(1) 响应评估和(2) 响应生成。在响应评估模块中,对大型语言模型(LLMs)的响应进行评估和排序——这一任务通常由人工标注者完成,我们使用LLMs将其自动化。我们通过两步过程评估响应评估模块。在第一步中,我们使用三种不同的提示策略评估LLMs作为评估者的能力。在第二步中,我们将最优提示策略应用于比较LLM-as-a-Judge、LLMs-as-a-Jury和LLM Debate的性能。我们的评估表明GPT-4o-as-a-Judge在所有数据集上具有更高的一致性。对于响应生成模块,我们使用已识别的LLM评估者配置,并比较不同配置的LLM反馈循环(LLM Feedback Loop)。我们使用胜率来确定最佳的多模型生成配置。通过实验各种配置,我们发现以Llama为生成器、Gemma为评审者的LLM反馈循环,相比单模型Llama和Gemma分别取得了显著的71.8%和73.8%的胜率。在确定两个模块的最佳配置后,我们使用上述流程生成PO数据集。
引用
@article{arxiv.2408.08688,
title = {The Fellowship of the LLMs: Multi-Model Workflows for Synthetic Preference Optimization Dataset Generation},
author = {Samee Arif and Sualeha Farid and Abdul Hameed Azeemi and Awais Athar and Agha Ali Raza},
journal= {arXiv preprint arXiv:2408.08688},
year = {2025}
}