中文

PHOENIX:面向直接偏好优化的开源语言适配

计算与语言 2024-01-22 v1

摘要

近年来,大语言模型获得了极大的重要性,并在解决各种任务中展现出卓越的成果。然而,尽管取得了这些成就,在大语言模型的背景下仍有许多问题尚未得到解答。除了在推理中对模型的最佳使用以及将结果与期望规范对齐之外,将模型迁移到其他语言仍然是一个发展不足的研究领域。最近发表的 Llama-2 和 Zephyr 等模型为架构改进和人类反馈的使用提供了新见解。然而,关于将这些技术适配到其他语言的见解仍然很少。在本文中,我们基于最新的改进,将直接偏好优化(DPO)方法应用于德语。该模型可在 https://huggingface.co/DRXD1000/Phoenix 获取。

关键词

引用

@article{arxiv.2401.10580,
  title  = {PHOENIX: Open-Source Language Adaption for Direct Preference Optimization},
  author = {Matthias Uhlig and Sigurd Schacht and Sudarshan Kamath Barkur},
  journal= {arXiv preprint arXiv:2401.10580},
  year   = {2024}
}