中文

面向未来的泛化:缓解假新闻检测中的实体偏差

计算与语言 2022-04-21 v1 人工智能 机器学习

摘要

假新闻的广泛传播正日益威胁个人与社会。假新闻检测旨在过去新闻上训练模型并检测未来的假新闻。尽管已付出巨大努力,现有假新闻检测方法忽视了真实世界数据中无意的实体偏差,这严重影响了模型对未来数据的泛化能力。例如,在我们的数据中,2010–2017年含实体“Donald Trump”的新闻有97%为真,而该比例在2018年骤降至仅33%。这会导致在前一集合上训练的模型难以泛化至后者,因其倾向于将关于“Donald Trump”的新闻预测为真以求得更低训练损失。本文提出一种实体去偏框架(ENDEF),从因果效应视角缓解实体偏差,使假新闻检测模型泛化至未来数据。基于实体、新闻内容与新闻真实性之间的因果图,我们在训练时分别建模各原因(实体与内容)的贡献。在推理阶段,我们移除实体的直接影响以缓解实体偏差。在英语与中文数据集上的大量离线实验表明,所提框架能大幅提升基础假新闻检测器的性能,在线测试也验证了其实用优越性。据我们所知,这是首项显式提升假新闻检测模型对未来数据泛化能力的工作。代码已发布于 https://github.com/ICTMCG/ENDEF-SIGIR2022。

关键词

引用

@article{arxiv.2204.09484,
  title  = {Generalizing to the Future: Mitigating Entity Bias in Fake News Detection},
  author = {Yongchun Zhu and Qiang Sheng and Juan Cao and Shuokai Li and Danding Wang and Fuzhen Zhuang},
  journal= {arXiv preprint arXiv:2204.09484},
  year   = {2022}
}

备注

Accepted by SIGIR 2022