基于深度集成学习的新闻立场检测
计算与语言
2019-09-27 v1
摘要
假新闻中的立场检测是新闻真实性评估的重要组成部分,因为该过程通过理解不同信息源对核心声明的立场来辅助事实核查。2017 年举办的假新闻挑战赛第一阶段(FNC-1)即为此目的设立,其涉及估计新闻正文中相对于给定标题的立场。本论文从 FNC-1 中三个表现最佳系统的误差分析入手。基于该分析,选择一个简单但难以击败的多层感知机系统作为基线。随后,探索了三种改进基线的方法。第一种方法探索在训练模型时通过添加额外关键词特征来提高预测准确率的可能性,其中关键词被转换为指示向量后与基线特征拼接。基于误差分析手动筛选了一组关键词,其可能最佳反映假新闻标题与正文的某些特征。为使该筛选过程自动化,基于互信息(MI)理论创建了三种算法:基于 MI 立场类的关键词生成器、MI 定制类以及逐点 MI 算法。第二种方法基于词嵌入,引入 word2vec 模型并实现了两种文档相似度计算算法:wor2vec 余弦相似度与 WMD 距离。第三种方法是集成学习。将不同模型与两种连续输出组合算法配置在一起。10 折交叉验证表明,由简单词袋特征训练的三个神经网络模型集成表现最佳,因此选其参与 FNC-1。经超参数微调后,所选深度集成模型在 FNC-1 评估指标下以 34.25 分的显著优势击败 FNC-1 冠军团队。
引用
@article{arxiv.1909.12233,
title = {Deep Ensemble Learning for News Stance Detection},
author = {Wenjun Liao and Chenghua Lin},
journal= {arXiv preprint arXiv:1909.12233},
year = {2019}
}
备注
Poster presenataion of 5th IC2S2 in University of Amsterdam