衡量 AI 与人类繁荣的对齐程度
人工智能
2025-07-14 v2
摘要
本文介绍了 Flourishing AI Benchmark (FAI Benchmark),这是一种新颖的评估框架,从七个维度评估 AI 与人类繁荣的对齐程度:品格与美德、亲密社会关系、幸福与生活满意度、意义与目标、身心健康、财务与物质稳定性以及信仰与灵性。与关注技术能力或防止伤害的传统基准不同,FAI Benchmark 衡量 AI 模型在多大程度上能有效促进个人在这些维度上的繁荣。该基准通过包含 1,229 个客观和主观问题的综合方法,评估 LLM AI 系统在多大程度上与整体人类福祉的当前研究模型保持对齐。FAI Benchmark 使用专门的评判大语言模型 (LLMs) 和跨维度评估,采用几何平均评分以确保在所有繁荣维度上的均衡表现。对 28 个领先语言模型的初步测试表明,尽管一些模型接近整体对齐(最高得分模型达到 72/100),但没有模型在所有维度上达到可接受的对齐程度,特别是在信仰与灵性、品格与美德以及意义与目标方面。本研究建立了一个框架,用于开发积极支持人类繁荣而不仅仅是避免伤害的 AI 系统,对 AI 开发、伦理和评估具有重要意义。
引用
@article{arxiv.2507.07787,
title = {Measuring AI Alignment with Human Flourishing},
author = {Elizabeth Hilliard and Akshaya Jagadeesh and Alex Cook and Steele Billings and Nicholas Skytland and Alicia Llewellyn and Jackson Paull and Nathan Paull and Nolan Kurylo and Keatra Nesbitt and Robert Gruenewald and Anthony Jantzi and Omar Chavez},
journal= {arXiv preprint arXiv:2507.07787},
year = {2025}
}