基于间歇观察的欺骗策略在线学习
机器人学
2025-09-22 v2 多智能体系统
系统与控制
系统与控制
摘要
在监督控制场景中,自动化系统并非被持续监控,而是在已知界限内的零星时间点进行监控。我们研究欺骗问题,即代理人在观察发生时,追求私有目标,同时似乎地遵守监督者的参考策略。受现实人类监督者行为的启发,我们将问题置于理论心智(Theory of Mind)框架内:代表观察者信念和期望的表示。我们展示,理论心智可被重新用于引导在线强化学习(RL)以实现此类欺骗行为。我们模型化监督者的期望,并从中提炼出一个校准后的标量——若当前观察发生的预期证据。该标量结合了参考动作分布与当前动作分布的差异程度,以及代理人认为观察即将发生的信念。在此标量作为状态相关权重注入到 KL 正则化策略改进步骤中,用于在在线 RL 循环中,这一标量提供了平滑权衡自身利益与合规性的闭式更新,规避了手工或启发式策略。在现实世界、实时的硬件实验中,涉及海上(ASV)和空中(U UAV)导航,我们的 ToM 指导下的 RL 在线运行,实现了高回报和成功,同时以监督者期望校准的观察轨迹证据为导向。
引用
@article{arxiv.2509.14453,
title = {Online Learning of Deceptive Policies under Intermittent Observation},
author = {Gokul Puthumanaillam and Ram Padmanabhan and Jose Fuentes and Nicole Cruz and Paulo Padrao and Ruben Hernandez and Hao Jiang and William Schafer and Leonardo Bobadilla and Melkior Ornik},
journal= {arXiv preprint arXiv:2509.14453},
year = {2025}
}