RLSLM:一种将基于规则的社交 locomotion 模型与人类社交规范对齐的混合强化学习框架
人工智能
2025-11-17 v1
摘要
在不造成不适的情况下导航人类居住环境是社交感知智能体的关键能力。虽然基于规则的方法通过预定义的心理学原理提供可解释性,但常缺乏通用性和灵活性。相反,数据驱动的方法可以从大规模数据集中学习复杂行为,但通常效率低下、难以解释且难以与人类直觉对齐。为填补这一鸿沟,我们提出RLSLM,一种混合强化学习框架,将基于规则的社交 locomotion 模型——该模型基于实证行为实验——集成到强化学习框架的奖励函数中。社交 locomotion 模型生成一种受定向影响的社交舒适场,用于量化空间中的人类舒适度,从而实现与社交行为相吻合的导航策略,训练所需最少。RLSLM随后联合优化机械能和社交舒适,使智能体能够避免进入个人或群体空间。使用沉浸式 VR 环境的人类-智能体交互实验表明,RLSLM在用户体验方面优于最先进的基于规则模型。消融和灵敏度分析进一步表明,该模型在可解释性方面显著优于传统数据驱动方法。本工作提出了一种可扩展的人类中心方法,有效集成认知科学和机器学习,用于实际的社交导航。
引用
@article{arxiv.2511.11323,
title = {RLSLM: A Hybrid Reinforcement Learning Framework Aligning Rule-Based Social Locomotion Model with Human Social Norms},
author = {Yitian Kou and Yihe Gu and Chen Zhou and DanDan Zhu and Shuguang Kuai},
journal= {arXiv preprint arXiv:2511.11323},
year = {2025}
}
备注
AAAI 2026