中文

PHUDGE: Phi-3 作为可扩展评判者

机器学习 2024-05-16 v2 人工智能

摘要

在本文(兼技术报告)中,我们介绍了 PHUDGE,一个微调的 Phi-3 模型,在反馈测试、反馈 OOD、MT Human、偏好测试这 4 项任务上取得了 SOTA 结果,在延迟和吞吐量方面超越了所有现有模型。它不仅与 GPT-4 显示出非常强的相关性,而且在未见数据上以及绝对和相对评分任务中与人类标注者也高度相关。我们不仅解决了使用小型语言模型构建经济高效的生产级系统的问题,还表明因果建模本质上不仅速度慢,有时还会阻碍模型的学习能力,应尽可能用更简单的任务替代,以使整个系统更快、更好。我们证明,通过遵循系统的机器学习实验、深思熟虑的数据增强和重新定义问题本身,即使使用更少的训练数据,我们也能击败大 10 倍的模型。据我们所知,我们是第一个实验并展示使用闵可夫斯基距离(带惩罚项以控制损失平滑)作为交叉熵替代损失函数,以实现稳定训练和更好评分结果的广义推土机距离(即 Wasserstein 距离)的团队。

关键词

引用

@article{arxiv.2405.08029,
  title  = {PHUDGE: Phi-3 as Scalable Judge},
  author = {Mahesh Deshwal and Apoorva Chawla},
  journal= {arXiv preprint arXiv:2405.08029},
  year   = {2024}
}