中文

评估大型语言模型的提示可引导性

计算与语言 2025-02-18 v2 人工智能 人机交互

摘要

构建多元 AI 需要设计能够被塑造以代表广泛价值体系与文化的模型。实现这一目标首先需要能够评估给定模型在多大程度上能够反映各种人格。为此,我们提出了一个基准,用于评估模型人格作为提示函数的可引导性。我们的设计基于提示可引导性的形式化定义,该定义分析了模型的联合行为分布可从其基线偏移的程度。通过定义可引导性指数并检查这些指数如何随引导努力变化,我们可以估计模型在各种人格维度与方向上的可引导性。我们的基准表明,由于基线行为的偏斜以及许多人格维度上可引导性的不对称性,许多当前模型的可引导性是有限的。我们在 https://github.com/IBM/prompt-steering 发布了我们的基准实现。

关键词

引用

@article{arxiv.2411.12405,
  title  = {Evaluating the Prompt Steerability of Large Language Models},
  author = {Erik Miehling and Michael Desmond and Karthikeyan Natesan Ramamurthy and Elizabeth M. Daly and Pierre Dognin and Jesus Rios and Djallel Bouneffouf and Miao Liu},
  journal= {arXiv preprint arXiv:2411.12405},
  year   = {2025}
}

备注

Short version appeared at the Pluralistic Alignment workshop at NeurIPS 2024; extended version appeared at NAACL 2025