MoSEs:基于条件阈值的风格化专家混合模型的不确定性感知 AI 生成文本检测
计算与语言
2025-09-09 v3 人工智能
摘要
大型语言模型的快速发展加剧了公众对潜在滥用问题的关切。因此,构建可信赖的 AI 生成文本检测系统至关重要。现有方法忽略了风格化建模,主要依赖静态阈值,严重限制了检测性能。本文提出了风格化专家混合模型(Mixture of Stylistic Experts, MoSEs)框架,通过条件阈值估计实现风格化感知的不确定性量化。MoSEs 包含三个核心组件,即风格化参考库(Stylistics Reference Repository, SRR)、风格化感知路由器(Stylistics-Aware Router, SAR)以及条件阈值估计器(Conditional Threshold Estimator, CTE)。对于输入文本,SRR 可激活相应的参考数据并提供给 CTE。随后,CTE 联合建模语言统计属性和语义特征,以动态确定最优阈值。基于判别得分,MoSEs 给出具有相应置信水平的预测标签。我们框架在检测性能上比基线方法平均提升了 11.34%。更令人鼓舞的是,MoSEs 在低资源场景下的提升幅度更为显著,达到 39.15%。我们的代码已公开于 https://github.com/creator-xi/MoSEs。
引用
@article{arxiv.2509.02499,
title = {MoSEs: Uncertainty-Aware AI-Generated Text Detection via Mixture of Stylistics Experts with Conditional Thresholds},
author = {Junxi Wu and Jinpeng Wang and Zheng Liu and Bin Chen and Dongjian Hu and Hao Wu and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2509.02499},
year = {2025}
}
备注
EMNLP 2025