中文

ALIGNING MODEL EVALUATIONS WITH HUMAN PREFERENCES: 缓解语言模型评估中的token计数偏差

计算与语言 2024-07-19 v1 人工智能 人机交互

摘要

SLAM论文表明,驻地式小型语言模型(SLM)是一种可行且高性价比的API式大型语言模型(LLM)替代方案,如OpenAI的GPT-4,性能和稳定性相当。然而,SLAM也发现人类偏好与传统自动评估器之间存在差异。本后续论文探讨了通过解决偏差(特别是针对更高token计数的偏差)将LLM评估器偏好与人类评估对齐的方法。我们采用贝叶斯统计和t检验来量化此偏差,并开发了一种校准程序来调整GPTScorer。我们的发现显著改善了校准后LLM评估器与人类评估的对齐程度,涵盖多个应用场景。例如,推荐用例中spearman's ranking correlation得分从-27.27提升至44.55。这些结果凸显了在自动化评估中考虑偏差的重要性,以确保公平和准确的模型评估。校准过程提高了自动化评估器的可靠性,导致更符合人类价值观和期望的更好AI模型。本研究提供了一种稳健的方法,用于未来研究中的偏差纠正,强调了开发人类一致AI评估系统的可行性和优势。

关键词

引用

@article{arxiv.2407.12847,
  title  = {Aligning Model Evaluations with Human Preferences: Mitigating Token Count Bias in Language Model Assessments},
  author = {Roland Daynauth and Jason Mars},
  journal= {arXiv preprint arXiv:2407.12847},
  year   = {2024}
}