通过POST-Agency实现可关停的智能体
人工智能
2026-01-06 v3
摘要
许多人担心未来的人工智能体会抵抗关停。我提出一个想法——POST-Agents提案——以确保这种情况不会发生。我建议我们训练智能体以满足仅在等长轨迹间的偏好(POST)。然后我证明,POST连同其他条件蕴含了Neutrality+:智能体最大化期望效用,忽略轨迹长度上的概率分布。我论证了Neutrality+使智能体保持可关停,同时允许它们发挥作用。
引用
@article{arxiv.2505.20203,
title = {Shutdownable Agents through POST-Agency},
author = {Elliott Thornley},
journal= {arXiv preprint arXiv:2505.20203},
year = {2026}
}