中文

价值诱导如何重塑大语言模型的行为

计算与语言 2026-05-11 v1

摘要

对话式大语言模型通过针对特定行为特征(如好奇心、开放态度和同情心)和价值观(如有帮助性、无害性和诚实性)进行后训练,以提升实用性、确保安全性并改善与模型交互的用户体验。然而,价值观是复杂且相互关联的——诱导一种价值观可能影响另一种行为。此外,诱导某些价值观可能通过生成的语言使模型更具成瘾性或迎合性, potentially 对用户产生不利影响。我们研究了价值诱导的这些及其他意外效应。我们使用精选的价值子集对现有偏好数据集进行微调,测量价值诱导对其他价值表达、模型安全性、拟人化语言以及各种问答基准的影响。我们发现:(i) 诱导价值观会导致对其他相关价值,甚至对立价值的表达,(ii) 诱导积极价值观会提高安全性,(iii) 所有价值观都会增加拟人化语言的使用,使模型更具验证性和迎合性。

关键词

引用

@article{arxiv.2605.07925,
  title  = {How Value Induction Reshapes LLM Behaviour},
  author = {Arnav Arora and Natalie Schluter and Katherine Metcalf and Maartje ter Hoeve},
  journal= {arXiv preprint arXiv:2605.07925},
  year   = {2026}
}

备注

Accepted to Findings of ACL 2026