利用微博文本进行作者识别以支持社交媒体取证
计算与语言
2021-11-29 v2 信息检索
摘要
确立在线文本的作者是打击网络犯罪的基础。遗憾的是,某些平台上文本长度受限,使这一挑战更加困难。我们旨在识别限制为 140 字符的 Twitter 消息的作者。我们评估了文学分析中广泛使用的流行文体学特征,以及 URL、标签、回复或引用等特定的 Twitter 特征。我们使用了分别包含 93 和 3957 名作者的两个数据库。我们测试了不同大小的作者集合以及每名作者不同数量的训练/测试文本。通过自动选择进行特征组合进一步提升了性能。在大量训练推文(>500)的情况下,即使有数千名作者,仅用几十个测试推文即可达到良好的准确率(Rank-5>80%)。在较小样本量(10-20 条训练推文)下,可将搜索空间缩减 9-15%,同时保持从候选中检索到正确作者的高概率。在此类情况下,自动归因可为专家在嫌疑人搜索中节省大量时间。为完整起见,我们报告了验证结果。在少量训练/测试推文下,等错误率(EER)高于 20-25%,若有数百条训练推文则可降至 < 15%。我们还量化了所采用特征的计算复杂度和时间持久性。
引用
@article{arxiv.2008.01533,
title = {Writer Identification Using Microblogging Texts for Social Media Forensics},
author = {Fernando Alonso-Fernandez and Nicole Mariah Sharon Belvisi and Kevin Hernandez-Diaz and Naveed Muhammad and Josef Bigun},
journal= {arXiv preprint arXiv:2008.01533},
year = {2021}
}