社交媒体内容中水质分析的自然语言处理技术
计算与语言
2021-12-22 v1 社会与信息网络
摘要
本文介绍我们对 MediaEval 2021 任务即“WaterMM:社交媒体中的水质”的贡献。该任务旨在分析与水质相关的社交媒体帖子,特别关注水色、气味、口感及相关疾病等方面。为此,提供了一个包含文本与视觉信息及元数据的多模态数据集。考虑到可用内容的质量与数量,我们主要通过分别及以晚期融合方式联合采用三种不同模型来关注文本信息。这些模型包括 (i) 来自变换器的双向编码器表示(BERT)、(ii) 鲁棒优化的 BERT 预训练方法(XLM-RoBERTa),以及 (iii) 一个定制的长短期记忆(LSTM)模型,在官方测试集上分别获得总体 F1 分数 0.794、0.717、0.663。在融合方案中,所有模型被平等对待,性能相较最佳单模型未观察到显著提升。
引用
@article{arxiv.2112.11441,
title = {NLP Techniques for Water Quality Analysis in Social Media Content},
author = {Muhammad Asif Ayub and Khubaib Ahmad and Kashif Ahmad and Nasir Ahmad and Ala Al-Fuqaha},
journal= {arXiv preprint arXiv:2112.11441},
year = {2021}
}
备注
3 pages, 2 tables, 1 figure