中文

CSDR-BERT:一种用于中文科学数据集检索的预训练科学数据集匹配模型

信息检索 2023-03-31 v3

摘要

在开放科学运动下,互联网上开放共享的科学数据集数量不断增加,高效检索这些数据集是信息检索(IR)研究中的一项关键任务。近年来,大模型的发展,尤其是涉及大模型预训练与下游任务微调的预训练-微调范式,为 IR 匹配任务提供了新方案。在本研究中,我们在嵌入层使用原始 BERT token,在模型层通过引入 SimCSE 与 K-近邻(K-Nearest Neighbors)方法改进 Sentence-BERT 模型结构,并在优化阶段使用 cosent 损失函数优化目标输出。实验结果表明,通过对比实验与消融实验,我们的模型在公开数据集与自建数据集上均优于其他竞争模型。本研究探索并验证了预训练技术用于中文科学数据集语义检索的可行性与效率。

关键词

引用

@article{arxiv.2301.12700,
  title  = {CSDR-BERT: a pre-trained scientific dataset match model for Chinese Scientific Dataset Retrieval},
  author = {Xintao Chu and Jianping Liu and Jian Wang and Xiaofeng Wang and Yingfei Wang and Meng Wang and Xunxun Gu},
  journal= {arXiv preprint arXiv:2301.12700},
  year   = {2023}
}