通过轮次级优化重新审视性掠夺者的早期检测
机器学习
2025-03-11 v1 人工智能
计算与语言
摘要
在线诱导是一种严重的社会威胁,性掠夺者通过微妙且渐进的操纵逐渐诱骗儿童受害者。因此,对在线诱导的及时干预对于主动保护至关重要。然而,先前的方法未能确定最佳干预点(即急于下结论),因为它们依赖聊天级风险标签,导致对风险话语的监督较弱。为了实现及时检测,我们提出了速度控制强化学习(SCoRL)(代码和补充材料可在 https://github.com/jinmyeongAN/SCoRL 获取),其中包含一种源自诱导沟通理论(LCT)的实用策略。为了捕获掠夺者的轮次级诱骗行为,我们使用基于 LCT 的轮次级风险标签。然后,我们设计了一种新颖的速度控制奖励函数,该函数基于轮次级风险标签平衡速度和准确性之间的权衡;因此,SCoRL 能够识别最佳干预时机。此外,我们引入了用于精确评估的轮次级指标,识别出先前使用的聊天级指标的局限性。实验结果表明,SCoRL 有效地预防了在线诱导,提供了一种更具主动性和及时性的解决方案。进一步分析表明,我们的方法在直观地识别最佳早期干预点的同时提高了性能。
引用
@article{arxiv.2503.06627,
title = {Revisiting Early Detection of Sexual Predators via Turn-level Optimization},
author = {Jinmyeong An and Sangwon Ryu and Heejin Do and Yunsu Kim and Jungseul Ok and Gary Geunbae Lee},
journal= {arXiv preprint arXiv:2503.06627},
year = {2025}
}
备注
Accepted as a main conference paper at NAACL 2025