资源约束下理性智能体的涌现风险意识
人工智能
2025-09-25 v4 机器学习
摘要
具备智能体能力的高级推理模型(AI agents)被部署以与人类交互,并在(近似)效用函数和内部模型下解决序贯决策问题。当此类问题具有资源或失败约束,即一旦资源耗尽动作序列可能被强制终止时,智能体面临隐性的权衡,这重塑了其效用驱动(理性)的行为。此外,由于这些智能体通常由人类委托人授权代表其行事,约束暴露的不对称性可能会引发人类目标与智能体激励之间先前未预料到的错位。我们通过生存老虎机(survival bandit)框架对这一设定进行形式化,提供了量化生存驱动的偏好转移影响的理论和实证结果,识别了错位产生的条件,并提出了缓解风险寻求或风险规避行为产生的机制。因此,这项工作旨在增进对在此类生存压力下运行的 AI 智能体涌现行为的理解和可解释性,并为在关键资源受限环境中安全部署此类 AI 系统提供指导。
引用
@article{arxiv.2505.23436,
title = {Emergent Risk Awareness in Rational Agents under Resource Constraints},
author = {Daniel Jarne Ornia and Nicholas Bishop and Joel Dyer and Wei-Chen Lee and Ani Calinescu and Doyne Farmer and Michael Wooldridge},
journal= {arXiv preprint arXiv:2505.23436},
year = {2025}
}