“请相信我”:向人类终止者解释智能体行为
人机交互
2025-05-06 v2 人工智能
摘要
考虑一个场景:一个预训练的智能体在环境中运行,人类操作员可以决定暂时终止其运行并接管一段时间。这类场景在人机交互中很常见,例如自动驾驶、工厂自动化和医疗保健。在这些设置中,我们通常观察到两种极端情况之间的权衡——如果不允许接管,那么智能体可能采用次优甚至危险的策略。或者,如果接管次数过多,那么人类对智能体没有信心,极大地限制了其有用性。在本文中,我们形式化了这一设置,并提出了一种可解释性方案来帮助优化人类干预的次数。
引用
@article{arxiv.2504.04592,
title = {"Trust me on this" Explaining Agent Behavior to a Human Terminator},
author = {Uri Menkes and Assaf Hallak and Ofra Amir},
journal= {arXiv preprint arXiv:2504.04592},
year = {2025}
}
备注
6 pages, 3 figures, in proceedings of ICML 2024 Workshop on Models of Human Feedback for AI Alignment