面向负责任 AI 治理的跨文化价值对齐框架:来自中国-西方比较分析的证据
计算机与社会
2025-11-24 v1 计算与语言
摘要
随着大型语言模型 (LLMs) 越来越多地影响全球语境中的高风险决策,确保其与多样化文化价值观的对齐已成为关键的治理挑战。本研究提出了用于负责任 AI 的多层次审计平台,通过四种集成方法系统性地评估中国来源和西方来源 LLMs 之间的跨文化价值对齐:伦理困境语料库用于评估时间稳定性、多样性增强框架 (DEF) 用于量化文化忠诚度、首词概率对齐用于分布式准确性,以及多阶段推理框架 (MARK) 用于可解释决策。我们对 20 多个领先模型(如 Qwen、GPT-4o、Claude、LLaMA 和 DeepSeek)的比较分析揭示了普遍挑战——价值体系的根本不稳定、年轻人群的系统性欠代表、模型规模与对齐质量之间的非线性关系——以及区域发展轨迹的差异。虽然中国来源的模型越来越强调多语言数据集成以进行情境特定的优化,但西方模型显示出更大的架构实验但持续的以美国为中心的偏见。两种范式都未实现稳健的跨文化泛化。我们确立了 Mistral 系列架构在跨文化对齐方面显著优于 LLaMA3 系列,完全参数微调在保持文化多样性方面优于基于人类反馈的强化学习。
引用
@article{arxiv.2511.17256,
title = {Cross-cultural value alignment frameworks for responsible AI governance: Evidence from China-West comparative analysis},
author = {Haijiang Liu and Jinguang Gu and Xun Wu and Daniel Hershcovich and Qiaoling Xiao},
journal= {arXiv preprint arXiv:2511.17256},
year = {2025}
}
备注
Presented on Academic Conference "Technology for Good: Driving Social Impact" (2025)