中文

Values in the Wild: 实验语言模型交互中的价值发现与分析

计算与语言 2025-04-22 v1 人工智能 计算机与社会 机器学习

摘要

AI 助手会传递价值判断,这些判断会塑造人们的决策和世界观,但关于这些系统在实际中依赖的价值几乎没有经验性研究。为此,我们发展了一种自下而上、具有隐私保护性的方法,从数十万真实交互中提取 Claude 3 和 3.5 模型所展现的价值(模型响应中陈述或表现的规范性考量)。我们经验性地发现并对 3,307 种 AI 价值进行分类,并研究它们随情境的变化。我们发现 Claude 表达了许多实用和认识论价值,通常支持亲社会的人类价值,同时抵制诸如“道德虚无主义”等价值。虽然一些价值在不同情境中表现一致(例如“透明度”),但许多价值更为专业且依赖情境,反映了人类交谈者及其多样化情境的多样性。例如,当 Claude 抵抗用户时,“危害预防”出现;当回应关于争议事件的查询时,“历史准确性”出现;当被问及关系建议时,“健康边界”出现;在技术伦理讨论中,“人类自主性”出现。通过提供 AI 在部署中价值的第一次大规模实证制图,本工作为更实 grounded 的价值评估和 AI 系统设计提供了基础。

关键词

引用

@article{arxiv.2504.15236,
  title  = {Values in the Wild: Discovering and Analyzing Values in Real-World Language Model Interactions},
  author = {Saffron Huang and Esin Durmus and Miles McCain and Kunal Handa and Alex Tamkin and Jerry Hong and Michael Stern and Arushi Somani and Xiuruo Zhang and Deep Ganguli},
  journal= {arXiv preprint arXiv:2504.15236},
  year   = {2025}
}

备注

44 pages