通过生成冲突社会规范来对人类行为进行可解释的伦理评估
计算机与社会
2025-12-19 v1 人工智能
计算与语言
摘要
人类行为往往受到社会规范的指导或约束,这些规范被定义为共享的、常识性的规则。例如,对于动作"\textit{报告目睹犯罪""来说,社会规范就指导我们的行为方式,如"It is expected to be brave to report crimes"(报告犯罪是勇敢的)。当前那些通过大规模数据训练来评估人类行为价值(即支持或反对)的AI系统,缺乏基于明确规范的训练,难以解释,因而难以信任。仿照人类评估者考虑社会规范,有助于AI模型更好地理解和预测行为的价值。在多重规范共同作用的情况下,冲突规范会产生紧张情绪并直接影响人类行为。例如,在决定是否"\textit{报告目睹犯罪""时,一个人可能在"勇敢"和"自我保护"之间进行权衡。本文引入了\textit{ClarityEthic},一种新的伦理评估方法,通过生成人类行为背后的冲突社会规范来增强价值预测和解释,从而通过对比学习策略提升语言模型的道德推理能力。大量实验表明,我们的方法在强基准方法上取得了优异成绩,人类评估确认,生成的社会规范为人类行为评估提供了合理的解释。
引用
@article{arxiv.2512.15793,
title = {Explainable Ethical Assessment on Human Behaviors by Generating Conflicting Social Norms},
author = {Yuxi Sun and Wei Gao and Hongzhan Lin and Jing Ma and Wenxuan Zhang},
journal= {arXiv preprint arXiv:2512.15793},
year = {2025}
}
备注
Acceppt by Asia-Pacific Chapter of the Association for Computational Linguistics (2025)