论文:重新思考基于 LLM 的强化学习中顺序决策的隐私问题
机器学习
2025-06-19 v2 人工智能
摘要
强化学习 (RL) 在关键实际应用领域的崛起,迫切需要对 AI 系统中的隐私进行根本性的重新思考。传统隐私框架旨在保护孤立的数据点,但在序列决策系统中,敏感信息是从时间模式、行为策略和协作动态中生成的。现代 RL 范式,如联邦强化学习 (FedRL) 和基于 LLM 的强化学习人类反馈 (RLHF),加剧了这些挑战,因其引入了复杂、交互式和情境依赖的学习环境,而传统方法无法解决。在本位论文中,我们主张建立一种新的隐私范式,基于四个核心原则:多尺度保护、行为模式保护、协作隐私保护和情境感知适应。这些原则揭示了在 RL 系统日益普及的高风险领域(如医疗保健、自动驾驶和由 LLM 提供决策支持系统)之间,隐私、实用性和可解释性之间固有的内在冲突。为应对这些挑战,我们呼吁发展新的理论框架、实用机制和严格的评估方法,以整体上实现序列决策系统中的有效隐私保护。
引用
@article{arxiv.2504.11511,
title = {Position Paper: Rethinking Privacy in RL for Sequential Decision-making in the Age of LLMs},
author = {Flint Xiaofeng Fan and Cheston Tan and Roger Wattenhofer and Yew-Soon Ong},
journal= {arXiv preprint arXiv:2504.11511},
year = {2025}
}
备注
IJCNN 2025 Position Paper Track