中文

一种面向上下文感知的伦理AI对齐的制衡框架

计算与语言 2025-05-29 v3 人工智能

摘要

本文介绍了一种受三权分立政府体系启发,用于大型语言模型(LLM)伦理对齐的制衡框架。它实现了三个独立但相互作用的组件:作为知识生成执行分支的LLM,作为建立伦理护栏的立法分支的DIKE,以及作为上下文解释的司法分支的ERIS。除了结构分离之外,我们还解决了一个根本性挑战:调节情绪以塑造行为。借鉴心理学理论,即管理情绪反应可以防止有害行为,我们开发了一个自监督学习流程,将情绪映射到语言行为,从而通过情绪条件作用实现精确的行为调节。通过将这种方法与对抗性测试相结合,我们的框架展示了DIKE和ERIS如何引导语言行为走向伦理结果,同时在知识生成、伦理监督和上下文解释过程中保持独立性。

关键词

引用

@article{arxiv.2502.00136,
  title  = {A Checks-and-Balances Framework for Context-Aware Ethical AI Alignment},
  author = {Edward Y. Chang},
  journal= {arXiv preprint arXiv:2502.00136},
  year   = {2025}
}

备注

20 pages, 7 tables, 6 figures. arXiv admin note: substantial text overlap with arXiv:2405.07076