中文

基于内容特征对 Tor 暗网中具有影响力的隐藏服务进行排序

机器学习 2019-10-08 v1 信息检索 机器学习

摘要

Tor 暗网洋葱域中犯罪活动重要性的不均衡及其对终端用户吸引力的不同层次,使得衡量其影响力变得错综复杂。为此,本文提出一种新颖的基于内容的排序框架,以检测最具影响力的洋葱域。我们的方法包含一个建模单元,利用从五种不同资源提取的四十个特征来表示一个洋葱域:用户可见文本、HTML 标记、命名实体、网络拓扑和视觉内容;以及一个排序单元,该单元使用学习排序(Learning-to-Rank, LtR)方法,通过整合前述特征自动学习一个排序函数。基于与毒品相关的洋葱域的案例研究,我们获得如下结果。(1) 在所探索的 LtR 方案中,列表式(listwise)方法在排名前 10 的域上以 NDCG 0.95 优于基准方法。(2) 我们定量证明我们的框架超越基于链接的排序技术。此外,(3) 根据所选特征,我们观察到由文本、命名实体识别和 HTML 特征组成的文本内容,在效率和所得分数方面是最均衡的方法。所提出的框架可支持执法机构检测与可疑活动相关的最具影响力域。

关键词

引用

@article{arxiv.1910.02332,
  title  = {Content-Based Features to Rank Influential Hidden Services of the Tor Darknet},
  author = {Mhd Wesam Al-Nabki and Eduardo Fidalgo and Enrique Alegre and Deisy Chaves},
  journal= {arXiv preprint arXiv:1910.02332},
  year   = {2019}
}