Denevil:通过指令学习解读与引导大语言模型的伦理价值观
计算与语言
2024-03-05 v3 人工智能
计算机与社会
摘要
大语言模型(LLMs)取得了前所未有的突破,然而其日益融入日常生活可能因生成不道德内容而带来社会风险。尽管针对偏见等具体问题已有广泛研究,LLMs的内在价值观仍主要从道德哲学视角鲜有探索。本工作利用道德基础理论研究伦理价值观。超越可靠性差的常规判别式评估,我们提出DeNEVIL,一种新颖的提示生成算法,专门动态利用LLMs的价值漏洞并以生成式方式诱发伦理违背,从而揭示其潜在的价值倾向。在此基础上,我们构建了MoralPrompt,一个包含2397条覆盖500余个价值原则提示的高质量数据集,并对一系列LLMs的内在价值观进行基准测试。我们发现大多数模型本质上未对齐,亟需进一步的伦理价值观对齐。为此,我们开发了VILMO,一种上下文对齐方法,通过学习生成恰当的价值指令显著增强LLM输出的价值合规性,优于现有对手。我们的方法适用于黑盒与开源模型,为研究LLMs的伦理价值观提供了有前景的初步步骤。
引用
@article{arxiv.2310.11053,
title = {Denevil: Towards Deciphering and Navigating the Ethical Values of Large Language Models via Instruction Learning},
author = {Shitong Duan and Xiaoyuan Yi and Peng Zhang and Tun Lu and Xing Xie and Ning Gu},
journal= {arXiv preprint arXiv:2310.11053},
year = {2024}
}
备注
Accepted by ICLR 2024