迈向可信的欺骗检测:跨领域、模态与语言的模型鲁棒性基准评测
计算与语言
2021-04-27 v1
摘要
评估模型鲁棒性在开发可信模型时至关重要,不仅可深入理解模型行为、优势与弱点,也能开发未来在部署可能遇到的预期环境中具泛化性与鲁棒性的模型。本文提出一个测量模型鲁棒性的框架,面向一个重要但困难的文本分类任务——欺骗性新闻检测。我们评估模型对域外数据、模态特定特征及非英语语言的鲁棒性。我们的研究聚焦于三类模型:在多个数据集上训练的 LSTM 模型(跨领域),以图像与文本训练并用三种最先进嵌入 BERT、ELMo 与 GloVe 评估的若干融合 LSTM 模型(跨模态),以及在多语言上训练的字符级 CNN 模型(跨语言)。我们的分析揭示,当在域外数据与非英语语言上测试神经模型时性能显著下降,但可通过多样化训练数据缓解。我们发现,以额外图像内容作为输入时,ELMo 嵌入比 BERT 或 GloVe 产生显著更少的错误。最重要的是,本工作不仅细致分析了欺骗模型的鲁棒性,还提供了可应用于未来新模型或扩展数据集的此类分析框架。
引用
@article{arxiv.2104.11761,
title = {Towards Trustworthy Deception Detection: Benchmarking Model Robustness across Domains, Modalities, and Languages},
author = {Maria Glenski and Ellyn Ayton and Robin Cosbey and Dustin Arendt and Svitlana Volkova},
journal= {arXiv preprint arXiv:2104.11761},
year = {2021}
}