基于模糊理论评估语言模型中的 grooming 风险
计算与语言
2025-02-19 v1 人工智能
机器学习
摘要
编码隐式语言是语言模型面临的挑战,尤其是在需要保持高精度的高风险领域。自动检测线上儿童挑逼是此类关键领域之一,捕食者会使用显性与隐性语言的组合来传递有害意图。虽然近期研究表明类似 SBERT 的 Transformer 语言模型在预防性挑逼检测方面具有潜力,但它们主要依赖表层特征,借助维法护士人士和执法人员的对话来近似模拟真实受害者的挑逼过程。迄今为止,是否对这些特征和近似值合理尚未得到讨论。本文填补了这一空白,研究 SBERT 是否能够有效辨别对话中内在的不同挑逼风险程度,并评估其结果在不同参与者群体中的表现。我们的分析显示,尽管微调有助于语言模型学习分配挑逼评分,但它们在预测中表现出高方差,尤其是对于包含更高挑逼风险的情境。这些错误出现在:1) 使用间接言语路径来操纵受害者,以及2)缺乏性显性内容。这一发现凸显了语言模型在建模间接言语行为方面的必要性,尤其是那些被用于捕食者的模型。
引用
@article{arxiv.2502.12563,
title = {Evaluating Language Models on Grooming Risk Estimation Using Fuzzy Theory},
author = {Geetanjali Bihani and Tatiana Ringenberg and Julia Rayz},
journal= {arXiv preprint arXiv:2502.12563},
year = {2025}
}
备注
9 pages, 2 figures. Accepted for publication in the Proceedings of the NAFIPS International Conference on Fuzzy Systems, Soft Computing, and Explainable AI. NAFIPS'2024