谁陷害了 Roger Reindeer?通过片段分类对 Facebook 帖子去审查
计算与语言
2018-04-11 v1
摘要
本文考察在线新闻审查,聚焦于对身份的审查。对身份进行混淆可能出于各异的原因,从军事到司法皆有。在大多数情况下,这样做是为了保护个人不被敌意人士识别与迫害。然而,由于协作式网络以信息冗余为特征,同一事实由多个来源报道、且可能不采用相同审查限制策略的情况并不罕见。此外,社交网络用户披露个人信息的已知倾向导致了这样一种现象:对新闻的评论可揭示新闻本身所隐瞒的数据。这为我们提供了推断被审查新闻主体是谁的途径。我们提出一种文本分析方法的改编版以揭示被审查身份。该方法在合成场景上测试,但贴近真实用例。借助基于在 Facebook 页面帖子与评论片段上训练得到的上下文分类器的文本分析,我们取得了有前景的结果。尽管我们所处设置相当受限——例如仅考虑极短长度的片段——我们的系统仍能在超过 50% 的调研案例中成功检测出被审查姓名,从 10 个不同候选姓名中选出。这优于两个参考基线的结果。本文所报告发现除有严谨实验方法支撑且本身有趣外,也为进一步研究网络上审查这一隐患问题铺平了道路。
引用
@article{arxiv.1804.03433,
title = {Who framed Roger Reindeer? De-censorship of Facebook posts by snippet classification},
author = {Fabio Del Vigna and Marinella Petrocchi and Alessandro Tommasi and Cesare Zavattari and Maurizio Tesconi},
journal= {arXiv preprint arXiv:1804.03433},
year = {2018}
}
备注
Accepted for publication: Elsevier Online Social Networks and Media