人类利他行为的战略塑造:潜在状态 POMDP 框架
人机交互
2026-03-04 v1 机器人学
系统与控制
系统与控制
摘要
我们提出了一个决策理论框架,机器人能够在重复交互过程中战略性地塑造推断的人类利他状态。将人类的利他行为建模为随时间演化的潜在状态,机器人通过自身的动作(包括帮助和信号传递)学习推断并影响此状态。我们将其形式化为一个潜在状态 POMDP,面临观测有限的挑战,并使用期望最大化法学习状态转移和观测动态。 resulting 的基于信念的策略在任务目标和社交目标之间进行权衡,选择能够最大化长期合作结果的动作。我们使用用户研究数据评估了该模型,结果表明所学习的策略在团队绩效和提升人类观察到的合作行为方面均优于基线策略。
引用
@article{arxiv.2603.02379,
title = {Strategic Shaping of Human Prosociality: A Latent-State POMDP Framework},
author = {Zahra Zahedi and Xinyue Hu and Shashank Mehrotra and Mark Steyvers and Kumar Akash},
journal= {arXiv preprint arXiv:2603.02379},
year = {2026}
}
备注
This article has been published in IEEE Robotics and Automation Letters. https://ieeexplore.ieee.org/document/11410120