中文

对齐链:整合公众意愿与专家智能以实现语言模型对齐

人机交互 2024-11-19 v1 人工智能 计算机与社会

摘要

我们提出了一种衡量公众意愿与语言模型(LM)行为之间对齐程度的方法,该方法可应用于微调、在线监督和发布前安全检查。我们的“对齐链”(CoA)方法通过创建与规范性目标对齐的模型行为规则,再将规范性目标与公众意愿对齐,从而产生基于规则的奖励(RBR)。这种分解使非专业公众能够直接通过规范性目标指定其意愿,而专家智能则用于推导出最能实现这些目标的模型行为规则。我们通过将该方法应用于三个与心理健康相关的不同LM提示领域来验证我们的方法。我们展示了一个基于集体对话和基于桥接的排序的公众输入过程,该过程可可靠地产生至少获得96%±2%的美国公众支持的规范性目标。随后我们表明,心理健康专家为实现这些目标而制定的规则能够使RBR像人类专家一样评估LM响应与目标的对齐程度(Pearson r=0.841,AUC=0.964)。通过衡量与获得近乎一致公众支持的目标的对齐程度,这些CoA RBR提供了LM行为与公众意愿之间对齐程度的近似度量。

关键词

引用

@article{arxiv.2411.10534,
  title  = {Chain of Alignment: Integrating Public Will with Expert Intelligence for Language Model Alignment},
  author = {Andrew Konya and Aviv Ovadya and Kevin Feng and Quan Ze Chen and Lisa Schirch and Colin Irwin and Amy X. Zhang},
  journal= {arXiv preprint arXiv:2411.10534},
  year   = {2024}
}

备注

Pluralistic Alignment Workshop at NeurIPS 2024