中文

PERSONA:用于多元对齐的可重复测试基准

计算与语言 2024-07-25 v1

摘要

语言模型(LMs)的快速发展 necessitates robust alignment with diverse user values.然而,当前的偏好优化方法往往无法捕捉用户意见的多样性,反而强化多数观点,边缘化少数视角。我们引入 PERSONA,一个用于评估和改进 LM 多元对齐的可重复测试基准。我们从美国人口普查数据中程序化生成多样化的用户配置文件,生成 1,586 个具有不同人口统计和个性特征的合成人物。随后,我们生成包含 3,868 个提示和 317,200 个反馈对的大规模评估数据集。利用该数据集,我们系统评估了 LM 在角色扮演 diverse users 方面的能力,通过人类评判进行验证,并建立了用于多元对齐方法的基准 PERSONA Bench 以及广泛的数据集以创建新的和未来的基准。完整的数据集和基准可在此处获得:https://www.synthlabs.ai/research/persona。

关键词

引用

@article{arxiv.2407.17387,
  title  = {PERSONA: A Reproducible Testbed for Pluralistic Alignment},
  author = {Louis Castricato and Nathan Lile and Rafael Rafailov and Jan-Philipp Fränken and Chelsea Finn},
  journal= {arXiv preprint arXiv:2407.17387},
  year   = {2024}
}