利用神经网络与其他分类技术提升孟加拉语语义搜索性能的新方法
计算与语言
2020-02-26 v2 信息检索
摘要
长期以来,搜索一直是用户检索信息的重要工具。句法搜索匹配包含特定关键词(如用户历史、位置、偏好等)的文档或对象以改进结果。然而,查询与最佳答案常常无共同词项或仅有极少共同词项,句法搜索在此类情况下无法妥善工作。另一方面,语义搜索解决了这些问题,但受限于标注缺乏以及低资源语言情形下 WordNet 的缺失。本工作中,我们展示了利用半监督与无监督学习算法提升语义搜索性能的端到端流程。选取一个可用的孟加拉语语料库,主要赋予七类语义属性以开发系统。使用支持向量机、朴素贝叶斯、决策树与人工神经网络(ANN)测试了性能。我们的系统已达成在学习的随时间过程中利用知识库预测正确语义的效率。首先使用一个含约一百万句子的语料库(印度政府 TDIL 项目的产物)测试我们的系统,随后对其他语言进行了测试。作为一个认知系统,它可非常有助于在多语言环境下提升电子治理或移动治理中的用户满意度,亦可用于其他应用。
引用
@article{arxiv.1911.01256,
title = {A Novel Approach to Enhance the Performance of Semantic Search in Bengali using Neural Net and other Classification Techniques},
author = {Arijit Das and Diganta Saha},
journal= {arXiv preprint arXiv:1911.01256},
year = {2020}
}
备注
12 pages, 5 figures