基于多模型细粒度非线性融合的语义相似度计算模型
计算与语言
2022-02-08 v1
摘要
自然语言处理(NLP)任务已在诸多领域取得优异表现,包括语义理解、自动摘要、图像识别等。然而,多数面向 NLP 的神经网络模型以细粒度方式提取文本,不利于从全局视角把握文本含义。为缓解该问题,本文提出传统统计方法与深度学习模型相结合,以及一种基于多模型非线性融合的新型模型。该模型分别使用基于词性的 Jaccard 系数、词频-逆文档频率(TF-IDF)与 word2vec-CNN 算法度量句子相似度。依据各模型计算精度得到归一化权重系数并比较计算结果。将加权向量输入全连接神经网络给出最终分类结果。结果表明,统计句子相似度评价算法降低了特征提取的粒度,从而能从全局把握句子特征。实验显示,基于多模型非线性融合的句子相似度计算方法匹配率为 84%,模型 F1 值为 75%。
引用
@article{arxiv.2202.02476,
title = {Semantic Similarity Computing Model Based on Multi Model Fine-Grained Nonlinear Fusion},
author = {Peiying Zhang and Xingzhe Huang and Yaqi Wang and Chunxiao Jiang and Shuqing He and Haifeng Wang},
journal= {arXiv preprint arXiv:2202.02476},
year = {2022}
}