中文

基于提示词的大型语言模型价值引导

计算与语言 2025-11-24 v1 人工智能

摘要

大型语言模型越来越多地用于人类价值观至关重要的应用中。虽然经常采用模型微调以确保安全响应,但该技术是静态的,难以应用于涉及动态价值和偏好的日常情境。本文提出了一种实用、可复现且不依赖特定模型的程序,用于评估提示词候选是否能够有效地将生成文本引导 toward 特定人类价值,formalising 一种量化目标价值在生成响应中存在感和提升幅度的评分方法。我们将该方法应用于 Wizard-Vicuna 语言模型的一个变体,采用撒艾欧(Schwartz)基本人类价值理论,并通过一个结构化对话数据集进行评估。在该设置下,我们比较了基线提示词与明确以价值为条件的提示词,表明即使在不改变模型或动态优化提示词的情况下,仍可实现价值引导。

关键词

引用

@article{arxiv.2511.16688,
  title  = {Prompt-Based Value Steering of Large Language Models},
  author = {Giulio Antonio Abbo and Tony Belpaeme},
  journal= {arXiv preprint arXiv:2511.16688},
  year   = {2025}
}

备注

9 pages, 1 figure, 4 tables. Presented at the 3rd International Workshop on Value Engineering in AI (VALE 2025), 28th European Conference on AI. To appear in Springer LNCS