中文

从准确性到影响:面向工程架构与变革理论对齐的影响驱动AI框架(IDAIF)

人工智能 2025-12-10 v1

摘要

本文提出了影响驱动AI框架(IDAIF),一种将变革理论(ToC)原则与现代AI系统设计相结合的新型架构方法。随着AI系统日益影响高风险领域,包括医疗保健、金融和公共政策,对齐问题——确保AI行为与人类价值观和意图一致——已变得至关重要。当前方法主要优化技术性能指标,而忽视了AI部署的社会技术维度。IDAIF通过建立ToC五阶段模型(输入-活动-产出-结果-影响)与相应AI架构层(数据层-流水线层-推理层-智能体层-规范层)之间的系统映射来解决这一差距。每个层都融入了严格的理论基础:用于价值对齐的多目标帕累托优化、用于产出实现的分层多智能体编排、用于幻觉缓解的因果有向无环图(DAGs),以及用于公平性保证的基于人类反馈的强化学习(RLHF)对抗性去偏。我们为每个组件提供了正式的数学表述,并引入了一个管理假设失败的保障层,通过守护架构实现。三个案例研究展示了IDAIF在医疗保健、网络安全和软件工程领域的应用。该框架代表了从以模型为中心到以影响为中心的AI开发的范式转变,为工程师提供了构建道德、可信和有益社会的AI系统的具体架构模式。

关键词

引用

@article{arxiv.2512.08449,
  title  = {From Accuracy to Impact: The Impact-Driven AI Framework (IDAIF) for Aligning Engineering Architecture with Theory of Change},
  author = {Yong-Woon Kim},
  journal= {arXiv preprint arXiv:2512.08449},
  year   = {2025}
}