SASICM:一个用于潜台词识别的多任务基准
计算与语言
2021-07-06 v2 人工智能
摘要
潜台词是一种深层语义,需经过一轮或多轮表达转换后才能被获取。作为一种表达意图的流行方式,它非常值得研究。在本文中,我们尝试通过机器学习使计算机理解是否存在潜台词。我们构建了一个中文数据集,其源数据来自流行的社交媒体(如微博、网易云音乐、知乎和哔哩哔哩)。此外,我们还构建了一个名为SASICM的基线模型来处理潜台词识别。以GloVe为预训练模型的SASICMg的F1分数高达64.37%,比基于BERT的模型高3.97%,比包括支持向量机、逻辑回归分类器、最大熵分类器、朴素贝叶斯分类器和决策树在内的传统方法平均高12.7%,比包括MARIN和BTM在内的SOTA高2.39%。以BERT为预训练模型的SASICMBERT的F1分数为65.12%,比SASICMg高0.75%。SASICMg和SASICMBERT的准确率分别为71.16%和70.76%,可与前述其他方法相媲美。
引用
@article{arxiv.2106.06944,
title = {SASICM A Multi-Task Benchmark For Subtext Recognition},
author = {Hua Yan and Feng Han and Junyi An and Weikang Xiao and Jian Zhao and Furao Shen},
journal= {arXiv preprint arXiv:2106.06944},
year = {2021}
}
备注
34 pages, 6 figures, 6 tables. Submitted to the journal of artificial intelligence