以更少实现更优对齐:利用数据增强进行个性化评估
计算与语言
2024-12-11 v1 人工智能
摘要
大语言模型(LLM)的自动评估是当今的热门话题;然而,判断与评估任务往往具有主观性并受多种因素影响,使得适应性变得具有挑战性。尽管许多研究展示了最先进的专有 LLM 与人类评估者相比的能力,但它们往往难以随时间适应参考评估者,而这是实现个性化判断的要求。此外,许多工作尝试将开放 LLM 用作判断者或评估者,但这些努力常常忽视了处理稀缺数据的局限性。个性化判断本质上与有限数据场景相关,这在许多现实问题中很常见。我们的工作旨在提出一种数据增强技术,从有限数据中选择更有效的样本,以将开放 LLM 与人类偏好对齐。我们的工作在 Pearson 相关系数上相对于基线实现了约 7% 的提升,在数学推理评估任务上相对于基础模型(Llama3.1-8B-Instruct)实现了 30% 的提升,证明增强选择更有效的偏好数据使我们的方法超越了基线方法。
引用
@article{arxiv.2412.07429,
title = {Optimizing Alignment with Less: Leveraging Data Augmentation for Personalized Evaluation},
author = {Javad Seraj and Mohammad Mahdi Mohajeri and Mohammad Javad Dousti and Majid Nili Ahmadabadi},
journal= {arXiv preprint arXiv:2412.07429},
year = {2024}
}