中文

TrustDataFilter:利用可信知识库数据提高未知信息过滤效果

信息检索 2025-02-25 v1 人工智能 计算与语言

摘要

随着技术进步和市场变化,构建领域特定知识库的需求日益增加,这有助于提高模型性能或推动企业创新和竞争力。领域特定知识库的构建通常依赖网页爬虫或现有行业数据库,导致数据准确性和一致性问题。为应对这些挑战,我们考虑到领域数据特征,其中内部知识相互关联,提出了自然语言推理数据过滤框架(self-nli-TDF)。该框架将可信过滤后的知识与待过滤数据进行比较,通过推理关系从而提高过滤效果。该框架采用即插即用型大型语言模型进行可信度评估,并使用来自自然语言推理(NLI)领域的RoBERTa-MNLI模型进行推理。我们构建了生物学、辐射和科学三个领域的数据集,并使用RoBERTa、GPT3.5和本地Qwen2模型进行实验。实验结果表明,该框架提高了过滤质量,产生更一致可靠的过滤结果。

关键词

引用

@article{arxiv.2502.15714,
  title  = {TrustDataFilter:Leveraging Trusted Knowledge Base Data for More Effective Filtering of Unknown Information},
  author = {Jinghong Zhang and Yidong Cui and Weiling Wang and Xianyou Cheng},
  journal= {arXiv preprint arXiv:2502.15714},
  year   = {2025}
}

备注

12 pages, 8 figures, submitted to IEEE Transactions on Knowledge and Data Engineering