从描述性到规范性:揭示基于 LLM 的智能体的社会价值对齐
人工智能
2026-05-15 v1 计算与语言
计算机与社会
摘要
基于 LLM 的智能体的广泛应用要求其与人类的社会价值高度对齐。然而,当前的工作在自我认知、困境决策以及自我情感方面仍存在不足。为弥补这一点,我们提出了一种新颖的基于价值的框架,该框架采用 GraphRAG 将原则转化为基于价值的指令,并通过在特定对话上下文中检索合适的指令来引导智能体按预期行事。为了评估预期行为的比例,我们基于马斯洛需求层次理论和 Plutchik 情绪轮盘这两个著名理论定义了预期行为。通过在 DAILYDILEMMAS 基准上实验我们的方法,与基于提示的基线(包括 ECoT、Plan-and-Solve 和元认知提示)相比,我们的方法展现出显著的性能提升。我们的方法为 AI 系统中自我情感的出现奠定了基础。
引用
@article{arxiv.2605.14034,
title = {From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents},
author = {Jinxian Qu and Qingqing Gu and Teng Chen and Luo Ji},
journal= {arXiv preprint arXiv:2605.14034},
year = {2026}
}
备注
Accepted by CogSci 2026