中文

可信赖的人工智能:从模型到智能体确保可靠性与问责性

机器学习 2026-05-12 v1

摘要

在本论文中,我们开发了具有理论保证的算法,以确保机器学习(ML)系统的可靠性和问责性。随着机器学习系统从预测模型演进到生成模型和自主智能体,可信赖人工智能的格局已经发生转变。本论文介绍了基于信息论、优化和统计学习的工具,用于减轻偏差、减少任意决策、确保内容来源,以及在自主环境中评估LLM驱动的智能体。为了减轻传统机器学习模型中的偏差和任意性,我们引入了一种基于核的方法,以在传统人口统计类别可能忽略的复杂子群体上实现多重准确性。我们还开发了解决预测多重性的方法,即同等准确的模型会产生相互矛盾的个体预测。我们通过对大型语言模型(LLM)进行水印处理来确保生成式人工智能的问责性。我们刻画了水印检测与文本失真之间的信息论权衡,并通过利用最优传输和编码理论推导出最优水印策略。实证评估表明,我们的水印在语言生成和编码任务中实现了优越的检测-质量权衡。最后,我们通过首个完全由LLM驱动的供应链模拟器,在多智能体环境中评估了自主LLM智能体。LLM智能体提供了显著的性能提升,优于人类团队并将成本降低高达67%,但也引入了系统性风险,包括代价高昂的尾部事件。

关键词

引用

@article{arxiv.2605.08964,
  title  = {Trustworthy AI: Ensuring Reliability and Accountability from Models to Agents},
  author = {Carol Xuan Long},
  journal= {arXiv preprint arXiv:2605.08964},
  year   = {2026}
}

备注

PhD thesis