Values in the Wild: 实验语言模型交互中的价值发现与分析
计算与语言
2025-04-22 v1 人工智能
计算机与社会
机器学习
摘要
AI 助手会传递价值判断,这些判断会塑造人们的决策和世界观,但关于这些系统在实际中依赖的价值几乎没有经验性研究。为此,我们发展了一种自下而上、具有隐私保护性的方法,从数十万真实交互中提取 Claude 3 和 3.5 模型所展现的价值(模型响应中陈述或表现的规范性考量)。我们经验性地发现并对 3,307 种 AI 价值进行分类,并研究它们随情境的变化。我们发现 Claude 表达了许多实用和认识论价值,通常支持亲社会的人类价值,同时抵制诸如“道德虚无主义”等价值。虽然一些价值在不同情境中表现一致(例如“透明度”),但许多价值更为专业且依赖情境,反映了人类交谈者及其多样化情境的多样性。例如,当 Claude 抵抗用户时,“危害预防”出现;当回应关于争议事件的查询时,“历史准确性”出现;当被问及关系建议时,“健康边界”出现;在技术伦理讨论中,“人类自主性”出现。通过提供 AI 在部署中价值的第一次大规模实证制图,本工作为更实 grounded 的价值评估和 AI 系统设计提供了基础。
引用
@article{arxiv.2504.15236,
title = {Values in the Wild: Discovering and Analyzing Values in Real-World Language Model Interactions},
author = {Saffron Huang and Esin Durmus and Miles McCain and Kunal Handa and Alex Tamkin and Jerry Hong and Michael Stern and Arushi Somani and Xiuruo Zhang and Deep Ganguli},
journal= {arXiv preprint arXiv:2504.15236},
year = {2025}
}
备注
44 pages