StagePilot:用于阶段控制网络疤蜓模拟的深度强化学习智能体
机器学习
2026-02-06 v1 计算与语言
摘要
网络疤蜓是一种针对青少年的日益演变的威胁,亟需主动的教育干预。我们提出 StagePilot,一个基于离线强化学习的对话智能体,用于模拟网络疤蜓行为的阶段性进程,以用于预防培训。StagePilot 通过平衡用户情感和目标接近度的复合奖励来选择对话阶段,并受现实性和可解释性约束,使其仅能在相邻阶段之间转换。我们通过 LLM 基于模拟的方法进行评估,衡量阶段完成情况、对话效率和情感参与度。结果表明,StagePilot 生成的对话在现实性和连贯性方面均符合网络疤蜓动态。我们测试的多种方法中,IQL+AWAC 智能体在战略规划和情感连贯性之间取得最佳平衡,成功到达最终阶段的频率比基线高最高 43%,同时保持超过 70% 的情感对齐。
引用
@article{arxiv.2602.05060,
title = {StagePilot: A Deep Reinforcement Learning Agent for Stage-Controlled Cybergrooming Simulation},
author = {Heajun An and Qi Zhang and Minqian Liu and Xinyi Zhang and Sang Won Lee and Lifu Huang and Pamela J. Wisniewski and Jin-Hee Cho},
journal= {arXiv preprint arXiv:2602.05060},
year = {2026}
}