中文

可信 AI 必须考虑互动

机器学习 2025-11-04 v2 人工智能

摘要

可信 AI 包含许多使 AI 系统与人类价值观一致的理想方面,包括公平性、隐私、鲁棒性、可解释性和不确定性量化。最终,可信 AI 研究的目标是同时实现所有方面。然而,提升某一个方面的努力往往会引入意外的权衡,进而负面影响其他方面。在本位论文中,我们审查了这五个方面的重要方法,并系统性地考虑每一对方面,详细描述可能出现的负面互动。例如,将差分隐私应用于模型训练会放大偏差,削弱公平性。基于这些发现,我们立足于当前仅就一个或两个方面进行改进的研究实践是不够的。相反,可信 AI 的研究必须考虑各方面的互动,并在所有相关轴向上采用整体方法。为说明我们的观点,我们提供了实践者如何实现整合信任的指导方针,提供了互动如何影响金融行业的实例,以及 alternative views。

关键词

引用

@article{arxiv.2504.07170,
  title  = {Trustworthy AI Must Account for Interactions},
  author = {Jesse C. Cresswell},
  journal= {arXiv preprint arXiv:2504.07170},
  year   = {2025}
}

备注

Presented at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment