基于独白式社会场景模拟的大语言模型自对齐
计算与语言
2024-06-11 v3 人工智能
计算机与社会
摘要
将大语言模型(LLM)与人类价值观对齐对于减轻其滥用可能带来的潜在负面影响至关重要。借鉴社会学中“承认各方关切是塑造人类价值观的关键因素”这一见解,本文提出了一种通过模型自身进行对齐的新方向:社会场景模拟。为此,我们提出了 MATRIX,一种新颖的社会场景模拟器,它能够围绕用户的输入查询模拟真实场景,使 LLM 在回应前能够考量社会后果。MATRIX 充当了一个虚拟排练空间,类似于“独白式对话”(Monopolylogue),LLM 在其中扮演与查询相关的多种角色并进行自我练习。为了注入这种对齐能力,我们利用 MATRIX 模拟的数据对 LLM 进行微调,确保其在不牺牲推理速度的前提下遵循人类价值观。我们在温和假设下从理论上证明了配备 MATRIX 的 LLM 优于宪法 AI(Constitutional AI)。最后,大量实验验证了我们的方法在 4 个基准测试中优于超过 10 个基线模型。正如 875 次用户评分所证实的,我们微调后的 13B 参数规模 LLM 在与人类价值观对齐方面超越了 GPT-4。项目页面见 https://shuotang123.github.io/MATRIX。
引用
@article{arxiv.2402.05699,
title = {Self-Alignment of Large Language Models via Monopolylogue-based Social Scene Simulation},
author = {Xianghe Pang and Shuo Tang and Rui Ye and Yuxin Xiong and Bolun Zhang and Yanfeng Wang and Siheng Chen},
journal= {arXiv preprint arXiv:2402.05699},
year = {2024}
}
备注
32 pages, 9 figures