识别被劫持的评论
计算与语言
2021-09-27 v1 人工智能
信息检索
机器学习
摘要
虚假评论与评论操纵是全球在线市场中日益严重的问题。评论劫持是一种新兴的评论操纵手段,不道德的卖家“劫持”一个已有的商品页面(通常是有许多正面评论的页面),然后将标题、图片和描述等商品信息替换为完全不同商品的信息。由于先前的评论仍保留,新商品看起来好评如潮。然而,目前没有公开的评论劫持数据集,文献中对此手段也知之甚少。因此,本文提出一项三部分研究:(i)我们提出一种通过交换商品与评论来生成评论劫持合成标注数据的框架;(ii)随后,我们利用该数据评估 Twin LSTM 网络与 BERT 序列对分类器区分合法评论与被劫持评论的潜力;(iii)接着,我们将性能最佳的模型部署于原始数据中 31K 个商品(含 6.5M 条评论)的集合上,发现了数百个此前未知的评论劫持实例。
引用
@article{arxiv.2107.05385,
title = {Identifying Hijacked Reviews},
author = {Monika Daryani and James Caverlee},
journal= {arXiv preprint arXiv:2107.05385},
year = {2021}
}
备注
To be published in ACL-IJCNLP 2021 Workshop on e-Commerce and NLP (ECNLP)