中文

一种预测中国网络审查的分类系统方法

计算与语言 2025-02-07 v1 机器学习 社会与信息网络

摘要

本文致力于使用分类器预测一条微博帖子是否会受到中国互联网的审查。通过从 Fu 等人 (2021) 的随机抽样和中文分词策略,我们构建了一个带有二元审查标记的清洗后中文短语数据集。利用数据上的多种基于概率的信息检索方法,我们得出了 4 个用于分类的逻辑回归模型。此外,我们尝试使用预训练的 Transformer 模型来执行类似的分类任务。在评估了宏 F1 和 ROC-AUC 指标后,我们得出结论,微调后的 BERT 模型在性能上优于其他策略。

关键词

引用

@article{arxiv.2502.04234,
  title  = {A Classification System Approach in Predicting Chinese Censorship},
  author = {Matt Prodani and Tianchu Ze and Yushen Hu},
  journal= {arXiv preprint arXiv:2502.04234},
  year   = {2025}
}