中文

联邦细化大型语言模型:Kahneman-Tversky 与直接偏好优化之比较

机器学习 2025-02-21 v1 计算与语言

摘要

我们评估了Kahneman-Tversky 优化(KTO)作为大型语言模型(LLM)在联邦学习(FL)环境下的细化方法,与直接偏好优化(DPO)进行比较。以Alpaca-7B为基础模型,在两种方法下均在真实数据集上进行细化,并使用MT-Bench-1、Vicuna和AdvBench基准进行评估。此外,我们引入了重新分配数据集设置,由于KTO能够处理单一响应反馈,而DPO依赖成对响应,因此仅适用于KTO。我们的结果表明,KTO在其原始(KTOO)和重新分配(KTOR)配置下,在所有基准测试中均 consistently 优于DPO。在重新分配的设置中,KTO进一步通过在DPO无法应用的场景下保持优异性能来验证了其灵活性和韧性。这些发现确立了KTO作为FL环境中稳健且可扩展的细化方法,激励其在保护隐私、去中心化和异构环境中采用。

关键词

引用

@article{arxiv.2502.14187,
  title  = {Federated Fine-Tuning of Large Language Models: Kahneman-Tversky vs. Direct Preference Optimization},
  author = {Fernando Spadea and Oshani Seneviratne},
  journal= {arXiv preprint arXiv:2502.14187},
  year   = {2025}
}