基于 Web2Vec 的网页健康误information 检测:结构、内容与情境感知方法
信息检索
2024-07-12 v1
摘要
近年来,我们注意到大量由用户直接生成的在线内容在几乎没有外部控制的情况下传播,可能导致误information 的扩散。寻找有效解决方案仍在持续进行中,涵盖从意见垃圾信息到虚假新闻检测等不同的应用领域。更近期被研究的场景之一是,尽管在误information 传播可能带来的严重风险下,仍是线上健康信息 dissemination 的场景。早期方法主要关注针对 Web 页面内容的用户研究。更近期,针对 Web 页面和社交媒体内容开发了自动化方法,特别是随着新冠疫情的爆发。这些方法主要基于与机器学习关联的从在线内容中提取的手工特征。在本场景中,我们关注 Web 页面内容,其中仍有研究空间来研究结构、内容和情境特征以评估 Web 页面可信度的可能性。因此,本工作旨在研究这些特征与深度学习模型(即 Web2Vec)在 Web 页面嵌入表示中的有效性。
引用
@article{arxiv.2407.07914,
title = {Health Misinformation Detection in Web Content via Web2Vec: A Structural-, Content-based, and Context-aware Approach based on Web2Vec},
author = {Rishabh Upadhyay and Gabriella Pasi and Marco Viviani},
journal= {arXiv preprint arXiv:2407.07914},
year = {2024}
}