面向数字广告的多语言虚假信息检测
计算与语言
2022-07-22 v1 机器学习
摘要
在当今世界,在线虚假信息与宣传的泛滥程度前所未有。独立发布商的资金主要来源于数字广告,遗憾的是,发布虚假信息内容的发布商同样如此。尽管这对开放互联网造成了负面影响,但如何将此类发布商从广告库存中移除的问题长期被忽视。在这项工作中,我们迈出了快速检测并标记可能以虚假信息操纵公众的网站的第一步。我们构建了一个基于多语言文本嵌入的机器学习模型,该模型首先确定页面是否提及感兴趣的主题,然后估计内容具有恶意的可能性,从而生成一份将由人类专家审查的发布商候选名单。我们的系统使内部团队能够主动而非被动地将不安全内容列入黑名单,从而保护广告提供商的声誉。
引用
@article{arxiv.2207.10649,
title = {Multilingual Disinformation Detection for Digital Advertising},
author = {Zofia Trstanova and Nadir El Manouzi and Maryline Chen and Andre L. V. da Cunha and Sergei Ivanov},
journal= {arXiv preprint arXiv:2207.10649},
year = {2022}
}
备注
Disinformation Countermeasures and Machine Learning Workshop at ICML 2022