中文

可复现的生物医学句子相似度实验综述:基于字符串的方法达到最优性能

计算与语言 2023-01-11 v1 人工智能

摘要

本注册报告介绍了迄今为止规模最大且首次可复现的生物医学句子相似度实验综述,旨在:(1)阐明该问题的研究现状;(2)解决阻碍大多数现有方法评估的一些可复现性问题;(3)评估若干未经探索的句子相似度方法;(4)评估一个名为 Corpus-Transcriptional-Regulation 的未经探索的基准;(5)研究预处理阶段与命名实体识别(NER)工具对句子相似度方法性能的影响;以及最后,(6)弥补该研究方向方法与实验可复现资源的缺失。我们的实验综述基于单一软件平台,该平台配有详细的复现协议与数据集作为补充材料,以允许对所有实验进行精确复现。此外,我们引入了一种新的聚合字符串型句子相似度方法,称为 LiBlock,以及当前基于本体的方法的八种变体,和一个在 PMC-BioC 语料库全文文章上训练的新预训练词嵌入模型。我们的实验表明,我们新颖的基于字符串的度量在生物医学领域句子相似度任务上确立了新的最优性能,并显著优于此处评估的所有方法,除一种基于本体的方法外。同样,我们的实验证实预处理阶段与 NER 工具的选择对句子相似度方法的性能有显著影响。我们也详述了当前方法的一些缺陷与局限,并警示需要改进当前基准。最后,一个显著发现是,我们的新基于字符串的方法显著优于此处评估的所有最优机器学习(Machine Learning)模型。

关键词

引用

@article{arxiv.2205.08740,
  title  = {A reproducible experimental survey on biomedical sentence similarity: a string-based method sets the state of the art},
  author = {Alicia Lara-Clares and Juan J. Lastra-Díaz and Ana Garcia-Serrano},
  journal= {arXiv preprint arXiv:2205.08740},
  year   = {2023}
}

备注

48 pages, 4 figures, 17 tables, three appendices not included in pre-print version