中文

CSPRD:面向中国股市的金融政策检索数据集

计算与语言 2023-09-12 v2 计算工程、金融与科学

摘要

近年来,预训练语言模型(PLMs)的巨大进展引发了密集段落检索方法的广泛研究关注,并取得了令人瞩目的性能,该方法旨在从大规模语料中根据给定的问题检索相关段落。然而,现有大多数数据集主要以通用常识的事实型查询来评测模型,而金融与经济等专门领域由于缺少专家标注的大规模高质量数据集仍未被探索。在本工作中,我们提出一项新任务——政策检索,并引入中国股票政策检索数据集(CSPRD),其提供 700 余条由资深专家标注的招股说明书段落,对应我们从收集的中国政策语料(含 10k+ 条目)中相关的法规条文。基于词法、嵌入及微调双编码器模型的实验显示了我们提出的 CSPRD 的有效性,同时也表明仍有较大改进空间。我们的最佳基线在验证集上取得了 56.1% 的 MRR@10、28.5% 的 NDCG@10、37.5% 的 Recall@10 以及 80.6% 的 Precision@10。

关键词

引用

@article{arxiv.2309.04389,
  title  = {CSPRD: A Financial Policy Retrieval Dataset for Chinese Stock Market},
  author = {Jinyuan Wang and Hai Zhao and Zhong Wang and Zeyang Zhu and Jinhao Xie and Yong Yu and Yongjian Fei and Yue Huang and Dawei Cheng},
  journal= {arXiv preprint arXiv:2309.04389},
  year   = {2023}
}