面向多模态社交媒体事件过滤的小样本学习
机器学习
2022-11-21 v1 社会与信息网络
摘要
社交媒体已成为事件分析的重要数据源。在收集此类数据时,大多数数据对目标事件不包含有用信息。因此,尽早过滤掉这些噪声数据,以便人类专家进行进一步审查,至关重要。现有的大多数事件过滤解决方案依赖于全监督方法进行训练。然而,在许多现实场景中,无法获得大量标注样本。为处理事件过滤中少标注样本的训练问题,我们提出了一种基于图的小样本学习流程。我们还发布了 Brazilian Protest Dataset 来测试我们的方法。据我们所知,该数据集是事件过滤领域中首个聚焦于多模态社交媒体数据中抗议活动的数据集,其中大部分文本为葡萄牙语。我们的实验结果表明,仅使用少量标注样本(60个)时,我们提出的流程性能可与全标注数据集(3100个)相媲美。为促进研究社区,我们在 https://github.com/jdnascim/7Set-AL 上公开了我们的数据集与代码。
引用
@article{arxiv.2211.10340,
title = {Few-shot Learning for Multi-modal Social Media Event Filtering},
author = {José Nascimento and João Phillipe Cardenuto and Jing Yang and Anderson Rocha},
journal= {arXiv preprint arXiv:2211.10340},
year = {2022}
}
备注
Accepted in IEEE International Workshop on Information Forensics and Security - WIFS 2022, Shanghai, China