大规模条件下基于语义方法的通用网页争议检测的改进与鲁棒性
信息检索
2018-12-04 v1 计算与语言
摘要
检测通用网页中的争议是一项艰巨任务,但对于高效审核讨论和有效过滤问题内容却愈发关键。遗憾的是,争议横跨诸多主题与领域,并随时间剧烈变化。本文研究以神经分类器作为更鲁棒的通用网页争议检测方法。现有模型常将通用网页争议检测视为维基百科链接或精确词法匹配任务。争议多样且多变的性质表明语义方法更能胜任检测。我们训练可利用弱信号数据从文本中捕获语义信息的神经网络。通过借助词嵌入的语义特性,我们鲁棒地改进了现有争议检测方法。为评估模型随时间及未见主题的稳健性,我们在不同训练条件下评估模型表现,以测试跨时间、跨主题、跨领域性能及标注者一致性。由此我们证明,基于弱信号的神经方法更贴近人类对争议的估计,且对争议固有的变异性更具鲁棒性。
引用
@article{arxiv.1812.00382,
title = {Improved and Robust Controversy Detection in General Web Pages Using Semantic Approaches under Large Scale Conditions},
author = {Jasper Linmans and Bob van de Velde and Evangelos Kanoulas},
journal= {arXiv preprint arXiv:1812.00382},
year = {2018}
}
备注
Presented at the 27th ACM International Conference on Information and Knowledge Management (CIKM 2018)